OpenAI dévoile sa nouvelle génération de modèles linguistiques, promettant des avancées significatives en performance et en efficacité. Ce matin, la société a annoncé la disponibilité générale de sa famille GPT-5.6, composée de trois modèles : Luna, Terra et Sol, classés du plus petit au plus grand.

Une tarification compétitive et des capacités étendues

Les nouveaux modèles sont proposés à des prix variant selon leur taille : Luna à 1 dollar par million de tokens en entrée et 6 dollars en sortie, Terra à 2,50/15 dollars, et Sol à 5/30 dollars. Ces tarifs les placent en concurrence directe avec les modèles Claude Opus (5/25 dollars) et Fable 5 (10/50 dollars). Cependant, la comparaison directe reste complexe en raison des variations dans le nombre de tokens nécessaires pour des tâches identiques.

Tous les modèles partagent une date de coupure des connaissances au 16 février 2026, une fenêtre de contexte d’un million de tokens et un maximum de 128 000 tokens en sortie.

Des performances record dans les workflows professionnels

OpenAI met en avant des résultats impressionnants sur le benchmark Agents’ Last Exam, évaluant les performances sur des workflows professionnels dans 55 domaines. Le modèle Sol atteint un score de 53,6, dépassant Claude Fable 5 de 13,1 points en raisonnement adaptatif. Même en raisonnement moyen, Sol surpasse Fable 5 de 11,4 points, avec un coût estimé quatre fois inférieur. Cette efficacité se retrouve également chez les modèles plus petits, Terra et Luna, qui surpassent Fable 5 à un seizième du coût.

Un benchmark controversé

Cependant, les modèles GPT-5.6 ont été moins performants sur SWE-Bench Pro, où Claude Fable 5 a obtenu 80 % contre 64,6 % pour Sol. Cette disparité pourrait expliquer pourquoi OpenAI a publié un article critiquant les problèmes identifiés dans ce benchmark, estimant que 30 % des tâches sont défectueuses.

Nouvelles fonctionnalités API

Les modèles GPT-5.6 introduisent plusieurs innovations notables via leur API :

  • Programmatic Tool Calling : Permet aux modèles d’exécuter du JavaScript pour orchestrer des appels d’outils, potentiellement comblant le fossé entre les plateformes MCP et les sessions terminal complètes.
  • Multi-agent : Autorise la création de sous-agents pour des travaux parallèles et ciblés.
  • Prompt cache breakpoints : Offre un contrôle explicite sur les points de rupture du cache, bien que l’auto-détection reste disponible.
  • Détail original pour les images : Permet de traiter des images sans redimensionnement préalable.

Un aperçu pratique

Une page de démonstration met en avant les capacités des modèles avec 18 différents pélicans, testant divers niveaux de raisonnement. Les coûts varient de 0,71 cent pour Luna en effort minimal à 48,55 cents pour Sol en niveau maximal.

Ces innovations positionnent OpenAI comme un acteur majeur dans le domaine des modèles linguistiques, avec des implications potentielles pour les entreprises et les développeurs cherchant à intégrer ces technologies dans leurs workflows.