Accueil
EN

Chargement de l’index de recherche…

Tous les articles
1 min de lecture

Ce que Whisper + Coqui TTS m'ont appris sur la latence perçue

  • Whisper
  • TTS
  • Vocal
  • UX

Sur Sentinelle, le pipeline vocal complet — reconnaissance (Whisper), traitement, synthèse (Coqui TTS) — prenait autour de deux secondes de bout en bout sur le matériel de test. Deux secondes, c’est correct sur le papier. À l’usage, ça paraissait long.

Le temps réel n’est pas le temps perçu

Le pipeline traite tout séquentiellement : on attend la fin de la phrase, on transcrit, on génère la réponse, on synthétise, puis on joue l’audio. Chaque étape est raisonnable seule. Mises bout à bout, elles créent un silence continu — et un silence de deux secondes en conversation vocale se ressent très différemment d’un chargement de deux secondes sur une page web.

Ce qui a vraiment aidé

Pas une victoire en changeant de modèle. Le vrai gain est venu de découper le problème en morceaux plus petits perceptuellement :

  • Streaming de la synthèse : jouer les premiers segments audio dès qu’ils sont prêts, sans attendre la génération complète de la réponse.
  • Un signal sonore court pendant le traitement, plutôt qu’un silence total — le silence est ce qui se lit comme un bug, pas l’attente elle-même.
  • Réponses plus courtes par défaut, avec la possibilité de développer sur demande — moins de texte à synthétiser avant le premier son.

La leçon générale

Sur un système vocal, optimiser la latence mesurée et optimiser la latence perçue sont deux problèmes différents. Le second se résout souvent avec du design d’interaction, pas avec des modèles plus rapides.