Les poids promis sont bien arrivés le 27 juillet
Moonshot AI avait présenté Kimi K3 le 16 juillet 2026, avec un accès immédiat dans Kimi, Kimi Work, Kimi Code et son API, mais sans checkpoint téléchargeable. L’entreprise avait promis les poids complets au plus tard le 27 juillet. Cette étape est désormais confirmée : le dépôt officiel Hugging Face contient le modèle, sa configuration, son tokenizer, le code de chargement, la licence et le rapport technique.
Le dépôt affiche 1,56 To et 96 fichiers Safetensors, numérotés de model-00001-of-000096.safetensors à model-00096-of-000096.safetensors. Il s’agit du checkpoint complet, pas d’un adaptateur ou d’une version réduite. L’historique public et Tom’s Hardware confirment sa publication le 27 juillet, une date à distinguer de l’annonce et des services hébergés disponibles depuis le 16.
L’expression « open weight » reste plus exacte qu’« open source ». Moonshot livre les poids, le rapport, une configuration et les droits permettant de nombreux usages, mais pas le corpus d’entraînement complet ni tout ce qui serait nécessaire pour reproduire l’apprentissage depuis zéro. L’ouverture permet désormais d’auditer et de déployer le modèle ; elle ne rend pas le processus de création intégralement reproductible.
Une architecture MoE de 2,8 billions de paramètres
Le rapport technique précise la taille auparavant arrondie à 2,8 billions : Kimi K3 compte environ 2,78 billions de paramètres et en active 104,2 milliards par token. Son réseau comprend 93 couches, dont une dense et 92 Mixture of Experts. La pile d’attention répète trois couches Kimi Delta Attention, ou KDA, puis une Gated MLA, avec une dernière Gated MLA globale : 69 KDA et 24 Gated MLA au total. Attention Residuals récupère sélectivement des représentations produites plus tôt dans la profondeur.

Stable LatentMoE projette l’état caché de 7 168 à 3 584 dimensions avant le calcul des experts. Le routeur choisit 16 experts parmi 896 par token, auxquels s’ajoutent deux experts partagés ; chaque expert utilise une dimension intermédiaire de 3 072. Le modèle possède 96 têtes d’attention, un vocabulaire de 163 840 entrées et une fenêtre maximale de 1 048 576 tokens. La vision native repose sur MoonViT-V2, un encodeur de 401 millions de paramètres.
La quantification est intégrée dès l’ajustement supervisé, avec des poids MXFP4 et des activations MXFP8. Moonshot revendique une efficacité de mise à l’échelle environ 2,5 fois supérieure à Kimi K2, mais ce chiffre reste une mesure de l’éditeur. Les évaluations utilisent l’effort de raisonnement maximal et parfois des agents différents selon le modèle comparé ; elles montrent un potentiel, pas un classement universel.
Raisonnement permanent et infrastructure de centre de données
Kimi K3 ne propose pas de mode sans raisonnement. Le champ reasoning_effort accepte low, high ou max, ce dernier étant la valeur par défaut. L’API renvoie le raisonnement dans reasoning_content. Pour une conversation à plusieurs tours ou des appels d’outils, l’intégrateur doit réinjecter le message complet de l’assistant, raisonnement et tool_calls inclus. Moonshot prévient qu’un historique tronqué ou le passage à K3 au milieu d’une session peut rendre la génération très instable.

Le dépôt recommande vLLM, SGLang et TokenSpeed, mais sa publication ne transforme pas K3 en modèle local pour PC. Les 104,2 milliards de paramètres actifs ne forment pas un sous-ensemble fixe : différents tokens sollicitent différents experts, donc tous les poids doivent rester accessibles. Le checkpoint occupe déjà 1,56 To avant le cache, les buffers et l’espace de travail. Une GeForce, une Radeon ou une station classique n’est pas une cible réaliste pour le modèle complet.

AMD a validé un service textuel sur huit Instinct MI355X de 288 Gio en parallélisme TP8. Sa recette estime environ 190,974 Gio de poids et 14,427 Gio d’état supplémentaire par accélérateur pour une séquence d’un million de tokens, avant espaces de travail et fragmentation. Cette démonstration vérifie le chargement fonctionnel, pas le débit ni la latence, et sa validation initiale limite les requêtes à 16 384 tokens. Moonshot recommande des supernœuds de 64 accélérateurs ou plus pour une inférence efficace à grande échelle.
Une licence spécifique autorisant l’usage commercial, avec des seuils précis
La Kimi K3 License autorise gratuitement l’utilisation, la copie, la modification, le déploiement, le fine-tuning, la distribution, la sous-licence et la vente de copies ou dérivés, à condition de conserver la notice de copyright et de respecter la loi. Ce n’est pourtant pas une licence commerciale sans condition.

Pour une activité « Model as a Service », définie comme un accès tiers à l’inférence ou au fine-tuning permettant un contrôle significatif sur les entrées, les paramètres ou les données d’entraînement, une entité et ses affiliés doivent conclure un accord séparé avec Moonshot avant tout usage commercial si leur chiffre d’affaires agrégé dépasse 20 millions de dollars sur douze mois consécutifs. Les capacités uniquement intégrées à des fonctions ou harnais spécifiques et le simple relais vers des modèles hébergés par d’autres échappent à cette définition.
Une seconde règle impose d’afficher visiblement « Kimi K3 » dans l’interface de tout produit ou service commercial utilisant le modèle et dépassant 100 millions d’utilisateurs actifs mensuels ou 20 millions de dollars de revenus mensuels. Ces obligations ne s’appliquent ni à l’usage strictement interne, sans exposition du logiciel, de ses sorties ou capacités à des tiers, ni à l’accès via les produits officiels de Moonshot ou ses partenaires d’inférence certifiés.
Le logiciel et ses sorties sont fournis sans garantie. L’ouverture permet désormais audits et reproductions, sans effacer les limites reconnues par Moonshot : sensibilité à l’historique de raisonnement, tendance à prendre trop d’initiatives face à une intention ambiguë et expérience encore en retrait face aux meilleurs modèles propriétaires. K3 est une publication majeure pour la recherche et l’hébergement professionnel, pas une solution prête à installer sur un PC gaming.
Commentaires
Chargement…
Préparation de votre espace lecteur…
Chargement des commentaires…