Qwen 3.8 27B, le dernier modèle d’Alibaba, impressionne par ses performances mais son réglage par défaut transforme chaque tâche en épopée cognitive.

Vendredi dernier, le laboratoire de recherche Qwen d’Alibaba a dévoilé Qwen 3.8 27B, un modèle de langage à 27 milliards de paramètres capable de traiter des images, sous licence Apache 2. Ce modèle suscite un vif intérêt, notamment pour sa taille optimale permettant une exécution sur des ordinateurs portables performants. Son prédécesseur, Qwen 3.6 27B, avait déjà marqué les esprits par ses capacités.

Les benchmarks auto-déclarés de Qwen 3.8 27B sont particulièrement remarquables. Ils montrent une amélioration par rapport à Qwen 3.6 27B ainsi qu’au modèle fermé Qwen 3.7-Plus, l’un des modèles les plus performants de Qwen jusqu’à présent. Les tests indépendants devraient confirmer ces résultats dans les prochaines semaines.

J’ai testé le modèle sur deux configurations différentes : un MacBook Pro M5 Max avec 128 Go de RAM et un NVIDIA DGX Spark. Dans les deux cas, j’ai utilisé LM Studio avec la version quantifiée Q4_K_M de 17 Go. J’ai également expérimenté avec llama-server directement sur le DGX Spark.

Un réglage par défaut qui pousse à l’extrême la réflexion

La documentation de Qwen indique que le modèle utilise par défaut un niveau xhigh pour l’effort de raisonnement. Voici ce que cela signifie :

  • xhigh (par défaut) : pour les tâches complexes nécessitant une analyse approfondie
  • medium : équilibre entre précision et vitesse
  • low : optimisation pour la rapidité et le coût

Ce réglage par défaut se révèle hilarant dans la pratique. Il n’est absolument pas adapté à une utilisation courante, surtout sur du matériel grand public. Les résultats obtenus sont extrêmement divertissants.

J’ai rapidement atteint la limite de contexte par défaut de 8 192 tokens dans LM Studio. Qwen utilisait toutes les ressources disponibles pour réfléchir à des problèmes des plus banals. J’ai augmenté la limite de contexte à 262 144 tokens, ce qui a résolu le problème.

Lors de ma première tentative avec cette nouvelle limite, j’ai demandé au modèle de générer une image SVG d’un pélican faisant du vélo. Le résultat a pris 21 minutes à générer, utilisant 22 276 tokens de raisonnement pour produire seulement 3 223 tokens de sortie. Vous pouvez consulter la trace de raisonnement ici.

Pélican faisant du vélo

L’image obtenue est sans doute la meilleure représentation d’un pélican à vélo que j’ai pu générer avec un modèle exécutable localement. Voici ce qui rend cette image remarquable :

  • Le cadre du vélo a la bonne forme
  • Il possède des pieds de chaque côté du vélo, ce qui est très rare
  • Le bec du pélican est bien représenté
  • Les ailes touchent les guidons !
  • Les lignes de mouvement sont placées derrière le vélo
  • L’arrière-plan est soigné avec un soleil, des nuages, une colline, des fleurs et de l’herbe

Cependant, était-ce vraiment utile d’attendre 21 minutes pour ce résultat ? Absolument pas.

J’ai réessayé la même demande en désactivant le raisonnement. Cette fois, le modèle a produit 3 715 tokens en seulement 137 secondes, soit un peu plus de deux minutes.

Pélican faisant du vélo sans raisonnement

En conclusion, Qwen 3.8 27B est un modèle extrêmement puissant, mais son réglage par défaut nécessite une attention particulière. Les utilisateurs devront probablement ajuster les paramètres pour obtenir des résultats optimaux sans sacrifier leur temps.