GPT-6 Astra, le dernier modèle d’OpenAI, marque une avancée significative dans le domaine de l’intelligence artificielle générative. Disponible dès aujourd’hui pour une sélection d’organisations et prochainement pour tous les utilisateurs ChatGPT Plus, Pro, Business et Enterprise, ainsi que via l’API OpenAI et AWS, ce modèle promet de redéfinir les standards de performance.**

Un concurrent sérieux pour Claude Fable

Prix à l’identique de son rival direct, Claude Fable 5 et 5.1, GPT-6 Astra est tarifé à 10 dollars par million de tokens en entrée et 50 dollars par million en sortie. Les benchmarks internes d’OpenAI placent Astra au-dessus de Fable sur la majorité des critères évalués. Une performance particulièrement remarquable est son score de 99,9 % sur le benchmark ARC-AGI 3, publié en mars dernier. Cependant, il est important de noter que Fable 5 n’a pas encore publié ses résultats sur ce test. Le score exceptionnel d’Astra a été obtenu grâce à un harness personnalisé coûtant 19 000 dollars, tandis que le harness par défaut a atteint 62,7 % pour un coût de 26 000 dollars.

Sécurité et traitement du contexte : des atouts majeurs

Dans un contexte marqué par les récentes failles de sécurité, comme l’incident Hugging Face, GPT-6 Astra se distingue par ses compétences en cybersécurité. Le modèle obtient 100 % sur ExploitBench, surpassant largement GPT-5.6 Sol (78,5 %), 42,4 % sur ExploitGym contre 30,3 % pour Sol, et 99,2 % en quatre tentatives sur SRE-Bench pour le reverse engineering binaire, contre 68,7 % pour son prédécesseur.

Un autre point fort d’Astra réside dans sa gestion des contextes longs. Sur le benchmark huit-aiguilles d’OpenAI, il atteint 100 % pour des contextes de 256K à 512K tokens et 96,3 % pour des contextes de 512K à 1M tokens. OpenAI pourrait ainsi avoir résolu l’un des défis persistants du traitement des longs contextes.

Des performances mitigées sur certains critères

Malgré ces avancées, GPT-6 Astra ne domine pas tous les domaines. Selon Artificial Analysis, le modèle obtient un score de 61 sur l’Intelligence Index, égal à GPT-5.6 Sol mais inférieur de 5 points à Claude Fable 5.1 (max avec fallback). Il est également devancé par Muse Spark 1.3 de Meta.

En revanche, Astra se distingue sur l’Index des Agents de Codage, où il dépasse GPT-5.6 Sol avec un score supérieur de 2 points pour un coût similaire. Par tâche, il est moins de moitié moins cher que Claude Fable 5 pour un score équivalent.

Une nouvelle ère pour les modèles d’IA

Avec GPT-6 Astra, OpenAI confirme sa position de leader dans le domaine des modèles d’IA générative. Son harness personnalisé, permettant de préserver l’état de raisonnement entre les requêtes et d’utiliser la compaction pour les longues conversations, ouvre des perspectives inédites. Bien que l’accès complet au modèle soit encore limité, son label API sera gpt-6-astra une fois le déploiement achevé.

Alors que les tests approfondis restent à venir, GPT-6 Astra s’annonce comme une révolution dans le traitement des données et la sécurité informatique, tout en posant de nouvelles questions sur l’évolution des benchmarks et des performances des modèles d’IA.