Les agents IA peinent encore à maîtriser les workflows complexes du commerce en ligne
Alibaba a soumis des modèles d’IA à un test grandeur nature pour évaluer leur capacité à accomplir des tâches commerciales réelles. Les résultats, publiés sur GitHub via le benchmark CommerceAgentBench, révèlent des performances mitigées malgré quelques avancées notables.
Un test exigeant pour mesurer les vraies compétences
Le géant chinois a évalué 13 familles de modèles sur 107 tâches concrètes allant de la création de fiches produits à la gestion logistique. Contrairement aux benchmarks traditionnels, le succès ne se mesurait pas à la qualité du texte généré, mais à l’exécution parfaite de chaque étape. Claude Opus 5 s’est imposé comme le meilleur élève avec un taux de réussite de 61,7%, un score que Kuo Zhang, président d’Alibaba.com, qualifie à la fois de ‘suffisamment utile’ et ‘assez inquiétant’.
Les évaluations se sont basées sur des données réelles : 10 millions d’utilisateurs actifs, 1,6 million de conversations et 200.000 traces d’exécution. Les agents ont dû traiter des emails non structurés, détecter des fraudes de paiement ou encore calculer des coûts à l’arrivée - des compétences cruciales pour le commerce moderne.
Les limites révélées par les échecs
L’analyse des résultats montre que les agents butent sur les workflows complexes nécessitant de maintenir une cohérence entre plusieurs étapes. Les cas d’échecs récurrents incluent :
- L’identification d’anomalies de paiement dans des fils de discussion de 300 messages
- Le calcul des coûts à l’arrivée lorsque plusieurs variables varient simultanément
- La résolution de litiges après-vente impliquant des documents contradictoires
- L’organisation de routes logistiques multi-étapes
Le modèle leader, Claude Opus 5, a nécessité en moyenne 63 appels d’outils et 10 minutes par tâche, soulignant la lourdeur des processus actuels.
L’importance cruciale du ‘harness’
Les performances varient significativement selon le système d’exploitation (ou ‘harness’) utilisé. Claude Opus 5 a obtenu 61,7% de réussite avec Accio, 60,7% avec Pi et seulement 56,1% avec OpenClaw. Gemini 3 Flash a fermé la marche avec un taux de réussite uniforme de 29%. Ces résultats plaident pour une approche modulaire où différents modèles seraient spécialisés par type de tâche.
L’adoption progressive par les consommateurs et commerçants
Côté marché, 132 millions d’adultes américains ont déjà utilisé l’IA pour leurs achats, avec Amazon en tête des plateformes (59% des transactions). Cependant, les commerçants restent prudents : 46% refusent de déléguer la gestion des prix aux agents, suivis par 42% pour les fonctions liées à la fraude et aux litiges.
Alibaba invite désormais la communauté des développeurs à contribuer avec de nouveaux environnements de test, promettant d’intégrer les meilleures propositions dans les versions futures. Ces résultats ouvrent des perspectives claires pour l’amélioration des systèmes actuels, tout en rappelant que la route vers une automatisation complète du commerce reste semée d’embûches techniques.