Un modèle géant, mais 95 milliards de paramètres actifs
Alibaba a annoncé Qwen3.8-Max le 3 août 2026. Son architecture Mixture-of-Experts réunit 2 400 milliards de paramètres au total, soit 2,4 billions dans la notation anglophone, mais n’en active que 95 milliards pour traiter chaque requête. Cette distinction est essentielle : le nombre total décrit la capacité répartie entre les experts du modèle, pas la quantité de calcul mobilisée simultanément à chaque jeton. Elle ne permet donc pas, à elle seule, de déduire la vitesse, le coût d’inférence ou la qualité réelle par rapport à un modèle dense plus petit.
Qwen présente cette version comme son premier modèle de classe Max destiné à recevoir des poids ouverts. Ceux-ci ne sont toutefois pas disponibles au moment de l’annonce : l’équipe les promet pour la semaine suivante, sans communiquer de jour précis, de licence ni de format de téléchargement. La disponibilité vérifiable concerne pour l’instant l’API Qwen Cloud. Le modèle accepte du texte, des images et de la vidéo en entrée, puis produit du texte. Il vise surtout le codage, les agents capables d’utiliser des outils et les tâches longues demandant plusieurs étapes.

Une API à un million de jetons, facturée à l’usage
La fiche Qwen Cloud indique une fenêtre de contexte d’un million de jetons, avec un maximum de 991 000 jetons en entrée et de 131 000 en sortie dans la configuration standard. Le mode de raisonnement peut aller jusqu’à 262 000 jetons internes, tandis que son entrée maximale est annoncée à 983 000 jetons. Ces plafonds sont techniques : ils ne garantissent ni une attention uniforme sur tout le contexte, ni une réponse utile à la longueur maximale. Le temps de traitement, la consommation et le prix augmentent aussi avec le volume effectivement envoyé et généré.
Le tarif public est de 2 dollars par million de jetons en entrée et de 6 dollars par million en sortie. Qwen Cloud affiche également 0,25 dollar pour l’entrée issue du cache implicite, 2,50 dollars pour créer un cache explicite et 0,17 dollar pour le relire, toujours par million de jetons. Le coût complet dépend donc fortement de la longueur des réponses, de la réutilisation du contexte et du nombre d’appels effectués par un agent. Il faut y ajouter les éventuels frais liés aux outils externes, au stockage et à l’exécution de code.
Le service prend en charge les appels de fonctions, les sorties structurées, les traitements par lots, le cache et la recherche web. Qwen documente des interfaces compatibles avec les formats OpenAI et Anthropic, ainsi qu’une API Responses pour l’usage d’outils. Cette compatibilité peut simplifier une migration ou un essai dans un environnement existant, mais elle ne signifie pas que tous les paramètres, événements de streaming ou comportements d’outils sont identiques. Une validation sur une charge représentative reste nécessaire avant de remplacer un modèle en production.

Ce que cela change pour le codage et les agents IA
Pour les développeurs, l’intérêt concret se situe moins dans le chiffre de 2 400 milliards que dans la combinaison du long contexte, de l’appel d’outils et d’une tarification inférieure à celle de plusieurs modèles haut de gamme cités par Qwen. Le fournisseur met en avant TerminalBench 2.1, SWE-bench Pro, PaperBench et des évaluations maison consacrées au développement logiciel. Il décrit aussi un projet de ligne de commande maintenu de façon autonome pendant plus de dix jours et une reproduction de recherche menée sur environ 125 heures. Ces démonstrations suggèrent une endurance accrue, mais elles ont été sélectionnées et supervisées par l’équipe qui commercialise le modèle.
Le classement public Arena apporte un repère externe : Qwen3.8-Max y apparaissait cinquième au classement général consulté le 3 août, avec un score provisoire de 1 496 et 3 327 votes. Le résultat reste préliminaire et son intervalle d’incertitude autorise plusieurs positions possibles. Arena mesure en outre des préférences humaines sur des réponses comparées ; il ne remplace pas des essais portant sur un dépôt privé, une base documentaire particulière, la latence en Europe ou le respect d’un schéma JSON strict.
Qwen montre que les performances varient selon l’environnement qui orchestre les commandes, les outils et les retours d’erreur. Ce point est particulièrement utile pour les assistants de code : un bon modèle peut perdre une partie de son avantage si le harnais limite ses actions, tronque le contexte ou gère mal les échecs. Les équipes qui envisagent Qwen3.8-Max devraient comparer le taux de réussite de tâches complètes, le temps jusqu’au résultat, le nombre d’appels et le coût total, plutôt qu’un seul score de benchmark.

Des poids ouverts annoncés, avec plusieurs inconnues
La principale réserve concerne l’expression « open-weight ». Tant que les fichiers et leur licence ne sont pas publiés, il est impossible de confirmer les droits de modification, de redistribution ou d’usage commercial. Alibaba ne détaille pas non plus la mémoire nécessaire, le format de quantification, le nombre de GPU requis ni le débit attendu pour une installation locale. Avec 2 400 milliards de paramètres au total, le déploiement complet restera de toute façon hors de portée d’un PC de jeu classique ; d’éventuelles quantifications ne supprimeront pas les besoins d’infrastructure et d’expertise.
Les chiffres de performance demandent le même recul. Les tableaux officiels mélangent tests publics, variantes de harnais et évaluations internes ; les budgets de raisonnement ou les outils autorisés ne sont pas toujours comparables entre concurrents. Les résultats ne démontrent pas davantage la fiabilité sur des données récentes, la sécurité des commandes exécutées ou l’absence d’erreurs plausibles. Pour un usage agentique, les permissions minimales, l’isolation de l’exécution, la revue humaine et la protection des secrets restent nécessaires, quel que soit le rang du modèle.
Enfin, l’API implique l’envoi de données à un service tiers. Avant d’y transmettre du code propriétaire, des documents clients ou des contenus soumis à réglementation, une organisation doit vérifier les conditions contractuelles, la conservation des requêtes, les régions de traitement et ses propres obligations. Qwen3.8-Max élargit immédiatement le choix des modèles accessibles par API et pourrait devenir une option auto-hébergeable importante lorsque ses poids paraîtront. Cette seconde promesse devra cependant être réévaluée à partir des fichiers, de la licence et de tests indépendants, pas seulement à partir de l’annonce.



Commentaires
Chargement…
Préparation de votre espace lecteur…
Chargement des commentaires…