Accueil
EN

Chargement de l’index de recherche…

Tous les projets
IA multimodaleActif

Sentinelle

Un agent vocal multimodal qui estime la charge cognitive en contexte clinique.

Projet personnel2026
  • IA multimodale
  • RAG
  • CNN-LSTM
  • Whisper
  • TTS
  • MLOps
Illustration abstraite d'une onde de signal, motif du projet Sentinelle

Contexte

Sentinelle explore une question de recherche appliquée : peut-on estimer, en continu et sans capteur intrusif, la charge cognitive d’un praticien pendant une tâche clinique ?

Problème

Les indicateurs de charge cognitive existants demandent souvent des capteurs dédiés, peu compatibles avec un usage clinique courant. Il fallait une estimation utilisable avec des signaux multimodaux plus légers, et une interaction vocale naturelle pour rester dans le flux de travail.

Architecture

  • Estimation de la charge cognitive : un modèle CNN-LSTM (MobileNetV2 + LSTM) entraîné sur des signaux multimodaux issus de plusieurs jeux de données de référence — AVCAffe, RAVDESS, PoseTrack, BIWI.
  • Agent RAG : Mistral / Ollama + LangChain + ChromaDB, pour ancrer les réponses du copilote dans une documentation clinique de référence.
  • Pipeline vocal speech-to-speech : reconnaissance vocale (Whisper), traitement, puis synthèse vocale (Coqui TTS), pour un copilote qui reste dans la conversation.
  • Backend FastAPI et dashboard React pour le suivi, avec une couche MLOps pour le cycle de vie des modèles.

Stack

Python pour le traitement du signal et les modèles CNN-LSTM (MobileNetV2 + LSTM), Whisper pour la reconnaissance vocale, Coqui TTS pour la synthèse, Mistral/Ollama + LangChain + ChromaDB pour le RAG, FastAPI + React pour le backend et le dashboard.

Résultats

  • Pipeline speech-to-speech fonctionnel de bout en bout en environnement de test.
  • Modèle CNN-LSTM entraîné et validé sur quatre jeux de données multimodaux de référence.

Captures

Captures d’écran à ajouter prochainement.