Notes du studio — rendre les agents IA fiables en production
Cette semaine, la flotte d’agents n’a pas livré de grande nouveauté, mais trois choix d’architecture repérés sur des chantiers en cours valent la peine d’être partagés : mettre en cache le tri des emails par IA plutôt que le recalculer à chaque clic, tenir un agent de conformité Qualiopi « en laisse » via des appels d’outils traçables, et forcer un contrôle de conformité assurantiel dans un schéma JSON strict plutôt qu’un résumé en prose. Trois leçons transférables pour tout dirigeant ou DSI qui met des agents IA en production.
Le tri des emails par IA : un résultat qu’on met en cache, pas une réponse qu’on interroge à chaque clic
Cette semaine, la flotte d’agents n’a livré aucune fonctionnalité phare chez ses clients, mais trois choix de conception repérés en relisant des chantiers en cours valent la peine d’être partagés — ils s’appliquent à toute PME qui envisage l’automatisation des emails par IA, ou plus largement des agents IA en production. Premier chantier : chez une société de coursiers, l’agent qui trie la boîte mail partagée (client urgent, souci chauffeur, facture, note interne…) ne relance pas un modèle de langage à chaque ouverture de message. Chaque email est classé une seule fois, selon un schéma de sortie strict, le résultat est écrit en base de données, et toute lecture suivante interroge cette base — pas le modèle. Si le modèle ou la base est momentanément indisponible, l’agent dégrade proprement plutôt que de bloquer la boîte mail. Traiter la sortie d’un modèle comme un effet de bord coûteux qu’on met en cache, plutôt que comme une dépendance interrogée en direct, est ce qui distingue une automatisation des emails par IA robuste d’une démo qui casse au premier redémarrage. Ce choix compte d’autant plus que la part des tâches qu’un modèle de langage peut réellement prendre en charge est large : une étude de 2023 signée Eloundou, Manning, Mishkin et Rock, GPTs are GPTs: An Early Look at the Labor Market Impact Potential of Large Language Models, estime qu’environ 80 % des actifs américains pourraient voir au moins 10 % de leurs tâches affectées par ce type de modèle — un chiffre qui explique pourquoi trier une boîte mail partagée vaut la peine d’être automatisé, et rend d’autant plus nécessaire de le faire de façon fiable plutôt qu’en interrogeant un modèle à chaque clic.
Un agent de conformité qui n’a le droit d’avancer qu’en appelant des outils
Deuxième chantier, chez un organisme de formation qui prépare son audit de certification qualité : l’assistant conversationnel qui accompagne un auditeur interne indicateur par indicateur est volontairement tenu « en laisse ». Il ne peut faire avancer l’audit qu’en appelant des outils explicites — enregistrer une réponse, associer une preuve, passer à l’indicateur suivant — qui écrivent dans une base relationnelle qui reste la seule source de vérité, jamais en improvisant librement dans la conversation. Pour un flux de conformité Qualiopi, ce choix sacrifie un peu de fluidité conversationnelle au profit d’une piste entièrement traçable et rejouable — ce qui compte davantage que l’éloquence quand un auditeur externe demande à voir précisément comment une réponse a été obtenue. C’est très exactement le principe validé par ReAct, une architecture d’agent proposée par Yao, Zhao, Yu, Du, Shafran, Narasimhan et Cao dans ReAct: Synergizing Reasoning and Acting in Language Models : en alternant un raisonnement explicite et des appels à des outils externes, plutôt qu’en laissant le modèle produire du texte libre, les auteurs montrent que les trajectoires obtenues sont à la fois plus fiables — moins d’hallucinations et d’erreurs qui s’accumulent — et plus faciles à vérifier après coup pour un humain.
Remplacer un résumé en prose par un schéma JSON strict, pour un agent qui tourne vraiment en production
Troisième chantier, chez un courtier en assurance qui compare une police d’assurance à un contrat sous-jacent pour repérer les trous de garantie : plutôt que de demander à l’agent un résumé en prose, sa réponse est forcée dans un schéma JSON strict — catégories fixes, niveaux de gravité, aucun champ libre — directement exploitable comme un tableau plutôt que comme un texte à reparser. Ce choix n’est pas gratuit : une étude de 2024 signée Tam, Wu, Tsai, Lin, Lee et Chen, Let Me Speak Freely? A Study on the Impact of Format Restrictions on Performance of Large Language Models, montre qu’un format de sortie trop contraint peut dégrader les capacités de raisonnement d’un modèle — mais que ce même resserrement améliore au contraire la précision sur des tâches de classification, exactement le cas d’un contrôle de conformité entre deux contrats. La leçon vaut pour tout dirigeant ou DSI qui met un agent IA en production : le format de sortie n’est pas un détail d’implémentation, c’est un arbitrage entre la richesse du raisonnement et la fiabilité de ce qui sort de la boîte noire — et le bon choix dépend de la tâche, pas d’une préférence esthétique pour le langage naturel.
Ressource gratuite
La grille d’auto-diagnostic : 20 tâches automatisables par l’IA
Commercial, administratif, support, opérations : les 20 tâches que des agents IA prennent déjà en charge en PME — avec, pour chacune, le signal qui montre que vos équipes sont concernées.