Sentinelle
Un agent vocal multimodal qui estime la charge cognitive en contexte clinique.
- IA multimodale
- RAG
- CNN-LSTM
- Whisper
- TTS
- MLOps
Contexte
Sentinelle explore une question de recherche appliquée : peut-on estimer, en continu et sans capteur intrusif, la charge cognitive d’un praticien pendant une tâche clinique ?
Problème
Les indicateurs de charge cognitive existants demandent souvent des capteurs dédiés, peu compatibles avec un usage clinique courant. Il fallait une estimation utilisable avec des signaux multimodaux plus légers, et une interaction vocale naturelle pour rester dans le flux de travail.
Architecture
- Estimation de la charge cognitive : un modèle CNN-LSTM (MobileNetV2 + LSTM) entraîné sur des signaux multimodaux issus de plusieurs jeux de données de référence — AVCAffe, RAVDESS, PoseTrack, BIWI.
- Agent RAG : Mistral / Ollama + LangChain + ChromaDB, pour ancrer les réponses du copilote dans une documentation clinique de référence.
- Pipeline vocal speech-to-speech : reconnaissance vocale (Whisper), traitement, puis synthèse vocale (Coqui TTS), pour un copilote qui reste dans la conversation.
- Backend FastAPI et dashboard React pour le suivi, avec une couche MLOps pour le cycle de vie des modèles.
Stack
Python pour le traitement du signal et les modèles CNN-LSTM (MobileNetV2 + LSTM), Whisper pour la reconnaissance vocale, Coqui TTS pour la synthèse, Mistral/Ollama + LangChain + ChromaDB pour le RAG, FastAPI + React pour le backend et le dashboard.
Résultats
- Pipeline speech-to-speech fonctionnel de bout en bout en environnement de test.
- Modèle CNN-LSTM entraîné et validé sur quatre jeux de données multimodaux de référence.
Captures
Captures d’écran à ajouter prochainement.