Les entreprises accélèrent l’autonomie des agents IA, mais leurs évaluations peinent à suivre. Une étude récente révèle un décalage alarmant entre la confiance accordée aux systèmes d’évaluation automatisés et l’autonomie réelle des agents IA en production.
Dans un échantillon de 157 entreprises, la moitié (50%) a déployé au moins un agent IA ayant réussi les évaluations internes avant de provoquer des échecs en production. Un quart a même connu ce scénario à plusieurs reprises. Pourtant, 66% des organisations autorisent déjà ou prévoient d’ici un an le déploiement automatique sans supervision humaine pour les agents à faible risque.
Un problème de fiabilité des évaluations
Seuls 5% des répondants affirment avoir une confiance totale dans les évaluations automatisées actuelles. Le principal défaut identifié (29%) est le manque d’alignement entre les tests et les résultats réels en production. Cette discordance crée un ‘évaluation gap’ - l’écart entre l’autonomie accordée aux agents et la fiabilité des tests censés garantir leur performance.
Des outils d’évaluation fragmentés
L’étude révèle une fragmentation des solutions utilisées. 17% des entreprises s’appuient sur les outils natifs fournis par leurs prestataires de modèles, tandis que 17% n’ont aucun outil dédié. Seules 25% effectuent des contrôles qualité en temps réel sur le trafic de production.
Des implications stratégiques
Cette situation pose un défi majeur pour les entreprises technologiques, particulièrement dans des secteurs comme la santé (12% des répondants) ou le commerce de détail (15%). Alors que l’autonomie des agents progresse rapidement, les mécanismes d’assurance qualité peinent à suivre ce rythme.
L’étude souligne l’urgence pour les entreprises de développer des cadres d’évaluation plus robustes, capables de refléter fidèlement les conditions réelles d’utilisation. Sans cela, le risque d’échecs coûteux en production pourrait freiner l’adoption plus large de ces technologies prometteuses.