Concevoir un agent vocal IA pour les moments les plus délicats de la vie

Des ingénieurs d'Empathy partagent les leçons architecturales tirées du développement d'un agent vocal IA pour préparer des conversations familiales sensibles.

GeektimeAuteur : Itay Tzafrir
Source
Concevoir un agent vocal IA pour les moments les plus délicats de la vie
Photo : Geektime / ה-LLMs שוברים הנחת יסוד בסיסית: אנחנו לא שולטים מראש בכל פלט שהמערכת תציג למשתמש

La création d'un agent vocal pour des moments émotionnellement sensibles boulevient les hypothèses fondamentales de l'expérience utilisateur. Chez Empathy, nous avons développé un produit d'IA conversationnelle conçu pour aider les utilisateurs à se préparer à des discussions difficiles, telles que l'annonce de dispositions testamentaires ou de choix successoraux à leurs proches. Si la rédaction juridique est une étape clé, les conversations humaines qui en découlent sont souvent les plus complexes à aborder. Un agent vocal permet aux utilisateurs de s'entraîner en amont dans un environnement sécurisé.

Au-delà des prompts : des barrières déterministes

Lors de nos hackathons internes, notre équipe a conçu un prototype simple associant un prompt de base et un flux vocal avec peu de garde-fous. Bien que fonctionnel, le passage en production a révélé deux types de défaillances majeures : des réponses manquant de nuances émotionnelles et des cas où l'agent glissait vers des conseils juridiques non sollicités. Pour y remédier, nous avons adopté un principe architectural fondamental : toute décision pouvant être prise de manière déterministe en dehors du modèle ne doit jamais lui être confiée.

Nous avons réparti les responsabilités entre plusieurs couches logiques. La logique métier définit les parcours conversationnels autorisés, une couche de contexte dédiée filtre les informations pertinentes, les prompts orientent le ton, et des garde-fous au niveau de la plateforme bloquent les dérives thématiques. Cette architecture multicouche garantit qu'aucune génération probabiliste ne franchit les limites de sécurité établies.

Gestion du contexte et cadres d'évaluation

La gestion du contexte s'est révélée tout aussi essentielle que l'ingénierie des prompts. Plutôt que de transmettre des structures de données brutes au modèle, nous avons développé une couche d'agrégation produisant un instantané contextuel minimal et pré-traçé pour chaque session. Cela garantit une observabilité totale lors des analyses de débogage.

Tester des systèmes génératifs non déterministes exige un cadre d'évaluation à trois niveaux, combinant des tests automatisés, des évaluations humaines pour mesurer la sensibilité et des agents synthétiques simulant des scénarios à grande échelle. Conjuguées à l'optimisation de la latence perçue, ces pratiques permettent d'atteindre une robustesse de niveau production.

Dans la même rubrique