La préversion devient un modèle à poids téléchargeables le 30 juillet
Thinking Machines Lab a publié Inkling-Small le 30 juillet 2026 avec ses poids complets. Le modèle avait été présenté en préversion aux côtés d’Inkling le 15 juillet, alors que les tests n’étaient pas terminés. La nouveauté réelle de cette semaine est donc la disponibilité des fichiers, de la carte modèle et des accès de personnalisation, pas la première apparition du nom Inkling-Small.
Inkling-Small est un transformer Mixture-of-Experts totalisant 276 milliards de paramètres, dont 12 milliards sont activés pour chaque token. Son grand frère Inkling atteint 975 milliards de paramètres au total et 41 milliards actifs. Thinking Machines présente ainsi le nouveau modèle comme environ quatre fois plus petit, tout en conservant une architecture clairsemée qui ne mobilise qu’une partie des experts à chaque étape d’inférence.
Le modèle a été entraîné sur des systèmes NVIDIA GB300 NVL72. Il accepte du texte, des images et de l’audio, propose un effort de raisonnement variable et une fenêtre de contexte pouvant atteindre un million de tokens. Cette limite maximale ne signifie pas que chaque interface, moteur d’inférence ou configuration de fine-tuning accepte automatiquement un million de tokens avec la même vitesse ou le même coût mémoire.
Poids complets sur Hugging Face, fine-tuning sur Tinker
Les poids sont proposés dans le dépôt officiel Thinking Machines sur Hugging Face. Le laboratoire rend aussi Inkling-Small disponible pour le fine-tuning avec Tinker et pour des conversations texte, image et audio dans Tinker Playground. L’ouverture des poids permet l’inspection, l’hébergement et l’adaptation hors d’une API fermée, sous réserve de lire la licence, la politique d’usage et les dépendances du runtime choisi.

Le billet utilise un prix de sortie de 1,20 dollar par million de tokens pour estimer ses courbes de coût, contre 4,05 dollars pour Inkling. Ce prix de référence ne couvre pas nécessairement le préremplissage, l’entraînement, le stockage ou l’infrastructure d’un déploiement privé. La documentation Tinker distingue d’ailleurs plusieurs configurations et types de tokens ; une comparaison financière doit reprendre le parcours réellement utilisé.
Le nom « Small » est relatif à la famille Inkling. Les 12 milliards de paramètres actifs réduisent le calcul par token, mais le checkpoint complet contient toujours 276 milliards de paramètres. La précision, la quantification, le cache de contexte et le runtime déterminent la mémoire requise. Thinking Machines ne promet pas une exécution fluide sur une seule carte RTX grand public ; un hébergement local peut nécessiter plusieurs GPU ou un offload important vers la RAM.
Des scores de codage élevés, avec un recul net en factualité
Thinking Machines rapporte 80,2 % sur SWE-bench Verified, 64,7 % sur Terminal-Bench 2.1 et 31,6 % sur Humanity’s Last Exam en texte seul. Dans le même tableau, Inkling obtient respectivement 77,6 %, 63,8 % et 29,7 %. Ces résultats soutiennent l’idée d’un modèle plus efficace sur certaines tâches agentiques, mais ils proviennent majoritairement du laboratoire et utilisent des harnesses précis.
Le bilan n’est pas uniformément favorable. Sur SimpleQA Verified, Inkling-Small affiche 20,6 %, contre 43,9 % pour Inkling. Thinking Machines reconnaît que le grand modèle conserve un avantage de couverture des connaissances et de factualité. Un score supérieur en correction de code ne doit donc pas être converti en supériorité générale pour la recherche, la rédaction factuelle ou les réponses sans outils.

Pour l’image, le modèle divise les entrées en blocs de 40 × 40 pixels transformés par un hMLP de quatre couches. L’audio est représenté sous forme de spectrogrammes dMel. Les deux modalités sont ensuite intégrées avec les tokens texte. Le laboratoire affirme que le modèle peut utiliser Python pour recadrer, zoomer et inspecter des documents ; cette capacité dépend néanmoins du harness et de l’accès effectif aux outils.
Benchmarks, mémoire et ouverture : les limites à garder visibles
La table globale a été mesurée avec un effort fixé à 0,99 et une température de 1,0. Les évaluations de codage autorisent des trajectoires pouvant atteindre 256 000 tokens. Pour SWE-bench, Thinking Machines utilise un harness limité à Bash ; pour Terminal-Bench, un harness interne. Quelques solutions contaminées par une recherche web ont reçu un score nul. Ces choix rendent une comparaison directe avec une autre publication délicate.

Le laboratoire réutilise aussi des résultats d’Artificial Analysis, Scale AI, ARC Prize et d’autres organismes lorsqu’ils sont disponibles. Cette démarche élargit le comparatif, sans rendre tous les protocoles identiques. Il manque encore des mesures indépendantes du checkpoint final sur du matériel documenté, en français, avec consommation électrique, mémoire de poids, débit à long contexte et qualité après quantification.
Inkling-Small est donc une publication significative pour l’écosystème des poids ouverts, surtout grâce à sa multimodalité et à son coût de calcul actif inférieur à Inkling. Il ne devient pas pour autant un petit modèle de bureau. Les équipes intéressées doivent évaluer la licence, la mémoire totale, le moteur d’inférence, la longueur de contexte et la factualité avant de choisir entre auto-hébergement et service géré.



Commentaires
Chargement…
Préparation de votre espace lecteur…
Chargement des commentaires…