Les poids promis sont bien arrivés le 27 juillet

Moonshot AI avait présenté Kimi K3 le 16 juillet 2026, avec un accès immédiat dans Kimi, Kimi Work, Kimi Code et son API, mais sans checkpoint téléchargeable. L’entreprise avait promis les poids complets au plus tard le 27 juillet. Cette étape est désormais confirmée : le dépôt officiel Hugging Face contient le modèle, sa configuration, son tokenizer, le code de chargement, la licence et le rapport technique.

Le dépôt affiche 1,56 To et 96 fichiers Safetensors, numérotés de model-00001-of-000096.safetensors à model-00096-of-000096.safetensors. Il s’agit du checkpoint complet, pas d’un adaptateur ou d’une version réduite. L’historique public et Tom’s Hardware confirment sa publication le 27 juillet, une date à distinguer de l’annonce et des services hébergés disponibles depuis le 16.

L’expression « open weight » reste plus exacte qu’« open source ». Moonshot livre les poids, le rapport, une configuration et les droits permettant de nombreux usages, mais pas le corpus d’entraînement complet ni tout ce qui serait nécessaire pour reproduire l’apprentissage depuis zéro. L’ouverture permet désormais d’auditer et de déployer le modèle ; elle ne rend pas le processus de création intégralement reproductible.

Une architecture MoE de 2,8 billions de paramètres

Le rapport technique précise la taille auparavant arrondie à 2,8 billions : Kimi K3 compte environ 2,78 billions de paramètres et en active 104,2 milliards par token. Son réseau comprend 93 couches, dont une dense et 92 Mixture of Experts. La pile d’attention répète trois couches Kimi Delta Attention, ou KDA, puis une Gated MLA, avec une dernière Gated MLA globale : 69 KDA et 24 Gated MLA au total. Attention Residuals récupère sélectivement des représentations produites plus tôt dans la profondeur.

Tableau officiel des résultats de Kimi K3 sur plusieurs évaluations de programmation.
Les résultats sont publiés par Moonshot avec l’effort de raisonnement maximal et des harnais parfois différents selon les modèles.

Stable LatentMoE projette l’état caché de 7 168 à 3 584 dimensions avant le calcul des experts. Le routeur choisit 16 experts parmi 896 par token, auxquels s’ajoutent deux experts partagés ; chaque expert utilise une dimension intermédiaire de 3 072. Le modèle possède 96 têtes d’attention, un vocabulaire de 163 840 entrées et une fenêtre maximale de 1 048 576 tokens. La vision native repose sur MoonViT-V2, un encodeur de 401 millions de paramètres.

La quantification est intégrée dès l’ajustement supervisé, avec des poids MXFP4 et des activations MXFP8. Moonshot revendique une efficacité de mise à l’échelle environ 2,5 fois supérieure à Kimi K2, mais ce chiffre reste une mesure de l’éditeur. Les évaluations utilisent l’effort de raisonnement maximal et parfois des agents différents selon le modèle comparé ; elles montrent un potentiel, pas un classement universel.

Raisonnement permanent et infrastructure de centre de données

Kimi K3 ne propose pas de mode sans raisonnement. Le champ reasoning_effort accepte low, high ou max, ce dernier étant la valeur par défaut. L’API renvoie le raisonnement dans reasoning_content. Pour une conversation à plusieurs tours ou des appels d’outils, l’intégrateur doit réinjecter le message complet de l’assistant, raisonnement et tool_calls inclus. Moonshot prévient qu’un historique tronqué ou le passage à K3 au milieu d’une session peut rendre la génération très instable.

Graphique officiel comparant le score et le coût par tâche de Kimi K3 sur Kimi Code Bench V2.
Moonshot met en avant un compromis score-coût favorable sur son banc interne ; ce graphique ne mesure pas les besoins matériels du checkpoint.

Le dépôt recommande vLLM, SGLang et TokenSpeed, mais sa publication ne transforme pas K3 en modèle local pour PC. Les 104,2 milliards de paramètres actifs ne forment pas un sous-ensemble fixe : différents tokens sollicitent différents experts, donc tous les poids doivent rester accessibles. Le checkpoint occupe déjà 1,56 To avant le cache, les buffers et l’espace de travail. Une GeForce, une Radeon ou une station classique n’est pas une cible réaliste pour le modèle complet.

Résultats officiels de Kimi K3 sur trois évaluations internes de travail documentaire.
Les évaluations de travail documentaire restent des résultats Moonshot et ne prouvent ni un débit local, ni une latence de production.

AMD a validé un service textuel sur huit Instinct MI355X de 288 Gio en parallélisme TP8. Sa recette estime environ 190,974 Gio de poids et 14,427 Gio d’état supplémentaire par accélérateur pour une séquence d’un million de tokens, avant espaces de travail et fragmentation. Cette démonstration vérifie le chargement fonctionnel, pas le débit ni la latence, et sa validation initiale limite les requêtes à 16 384 tokens. Moonshot recommande des supernœuds de 64 accélérateurs ou plus pour une inférence efficace à grande échelle.

Une licence spécifique autorisant l’usage commercial, avec des seuils précis

La Kimi K3 License autorise gratuitement l’utilisation, la copie, la modification, le déploiement, le fine-tuning, la distribution, la sous-licence et la vente de copies ou dérivés, à condition de conserver la notice de copyright et de respecter la loi. Ce n’est pourtant pas une licence commerciale sans condition.

Visuel de lancement officiel de Kimi K3 publié par Moonshot AI.
Les poids complets sont désormais accessibles ; leur licence doit être vérifiée avant tout service commercial à grande échelle.

Pour une activité « Model as a Service », définie comme un accès tiers à l’inférence ou au fine-tuning permettant un contrôle significatif sur les entrées, les paramètres ou les données d’entraînement, une entité et ses affiliés doivent conclure un accord séparé avec Moonshot avant tout usage commercial si leur chiffre d’affaires agrégé dépasse 20 millions de dollars sur douze mois consécutifs. Les capacités uniquement intégrées à des fonctions ou harnais spécifiques et le simple relais vers des modèles hébergés par d’autres échappent à cette définition.

Une seconde règle impose d’afficher visiblement « Kimi K3 » dans l’interface de tout produit ou service commercial utilisant le modèle et dépassant 100 millions d’utilisateurs actifs mensuels ou 20 millions de dollars de revenus mensuels. Ces obligations ne s’appliquent ni à l’usage strictement interne, sans exposition du logiciel, de ses sorties ou capacités à des tiers, ni à l’accès via les produits officiels de Moonshot ou ses partenaires d’inférence certifiés.

Le logiciel et ses sorties sont fournis sans garantie. L’ouverture permet désormais audits et reproductions, sans effacer les limites reconnues par Moonshot : sensibilité à l’historique de raisonnement, tendance à prendre trop d’initiatives face à une intention ambiguë et expérience encore en retrait face aux meilleurs modèles propriétaires. K3 est une publication majeure pour la recherche et l’hébergement professionnel, pas une solution prête à installer sur un PC gaming.