ElevenLabs améliore son application avec le modèle v4 et une voix naturelle
ElevenLabs met à jour son application avec le modèle v4, offrant un discours plus naturel, des balises d'émotion et une faible latence pour les développeurs.

ElevenLabs a déployé une mise à jour majeure de son application et de sa plateforme de synthèse vocale, en intégrant son modèle avancé v4 et sa version Turbo. Cette mise à jour améliore considérablement le naturel de la voix générée, bien au-delà des voix robotiques monotones.
Architecture v4 avancée et contrôle émotionnel
Le passage à l'architecture v4 transforme la façon dont les systèmes de synthèse vocale traitent l'audio généré. Le modèle analyse le contexte complet des phrases avant et pendant la lecture, en ajustant dynamiquement l'intonation, le rythme et les pauses. Cela rend l'écoute d'articles longs ou de livres numériques beaucoup plus fluide.
L'une des fonctionnalités les plus intéressantes est la possibilité de contrôler précisément l'émotion à l'aide de balises textuelles intégrées. Les utilisateurs peuvent insérer des commandes spécifiques telles que [whisper], [laugh], [sigh] ou [sad] directement dans le texte pour moduler le ton du narrateur.
Haute performance pour les développeurs
Pour les développeurs créant des agents vocaux via l'API, la version v4 Turbo offre un bond en avant en matière de performances avec une latence exceptionnellement basse d'environ 100 millisecondes. Cela permet des conversations fluides en temps réel avec des robots basés sur des grands modèles de langage.
Les autres nouveautés de la version v4 incluent la prise en charge de 90 langues, dont l'hébreu, ainsi que la possibilité de cloner rapidement n'importe quelle voix à partir d'échantillons audio.





