Moonshot AI vient de dévoiler Kimi K3, présenté comme leur modèle le plus performant à ce jour avec 2,8 milliards de paramètres. Disponible dès maintenant via leur plateforme et API, les poids ouverts seront accessibles d’ici le 27 juillet 2026. Cette annonce marque une étape significative dans la course aux modèles open-source, dépassant largement le précédent record de DeepSeek avec son modèle de 1,6 billion de paramètres.
Les benchmarks autodéclarés par Moonshot placent Kimi K3 en tête sur plusieurs critères, surpassant des modèles comme Claude Opus 4.8 et GPT-5.5, bien qu’il reste derrière Claude Fable 5 et GPT-5.6 Sol. L’analyse d’Artificial Analysis révèle des performances impressionnantes : un Elo de 1547 dans les évaluations à long terme, soit une progression de +732 points par rapport à Kimi K2.6. Le coût par tâche s’élève à 0,94 $, comparable à GPT-5.6 Sol (1,04 $), mais bien inférieur à celui de Claude Opus 4.8 (1,80 $). Par ailleurs, Kimi K3 utilise 21 % de tokens en moins que son prédécesseur.
Un autre point notable est sa position dominante sur l’arène de code Frontend d’Arena.ai, où il dépasse même Claude Fable 5. Le modèle se distingue également par son prix élevé : 3 $/million de tokens en entrée et 15 $/million de tokens en sortie, soit le modèle le plus cher jamais proposé par un laboratoire chinois. Cette tarification représente une augmentation significative par rapport aux versions précédentes comme Kimi K2.6, dont le coût était de 0,95 $/4 $.
Pour tester les capacités créatives du modèle, un utilisateur a généré une image SVG d’un pélican faisant du vélo. Cette requête a nécessité 95 tokens en entrée et 16 658 tokens en sortie, pour un coût total de 25 cents. Une seconde analyse de l’image générée a permis d’obtenir une description détaillée pour seulement 0,6 cents.
Le test du pélican à vélo, initialement conçu comme une blague pour illustrer la difficulté de comparer les modèles d’IA, a paradoxalement servi pendant un temps comme indicateur fiable des performances. Cependant, cette corrélation s’est estompée avec l’évolution des modèles comme GPT-5.6 et Claude Fable 5, qui ne parviennent plus à rivaliser avec Kimi K3 sur ce critère.
Avec Kimi K3, Moonshot AI confirme sa position de leader dans le domaine des modèles open-source, tout en posant de nouvelles questions sur l’équilibre entre performance et coût dans le paysage concurrentiel de l’IA.