Luna à 0,20 dollar et Terra à 2 dollars par million de tokens
OpenAI a annoncé et appliqué ses nouveaux tarifs le 30 juillet 2026. La famille GPT-5.6 était déjà disponible publiquement depuis le 9 juillet : l’événement récent est donc une baisse de prix, pas le lancement des modèles. GPT-5.6 Luna coûte désormais 0,20 dollar par million de tokens en entrée et 1,20 dollar par million en sortie. OpenAI présente cette évolution comme une réduction de 80 %.
GPT-5.6 Terra passe à 2 dollars par million de tokens en entrée et 12 dollars en sortie, soit 20 % de moins. Le tarif de GPT-5.6 Sol reste inchangé. Ces montants concernent l’API et distinguent les tokens envoyés au modèle de ceux qu’il génère. Ils ne décrivent pas le prix mensuel d’un abonnement ChatGPT ou Codex et ne suffisent pas à prévoir la facture complète d’un agent utilisant des outils.

Le coût réel dépend aussi de la longueur de contexte, du cache, des appels d’outils, des reprises après erreur et du nombre de tokens de raisonnement ou de sortie. Une réduction de 80 % au tarif unitaire ne garantit donc pas une économie identique par tâche. Il faut comparer la qualité obtenue, le nombre d’appels nécessaires et la latence sur un même jeu d’évaluations plutôt que multiplier seulement un volume théorique de tokens.
Le mode Fast promet jusqu’à 2,5 fois la vitesse de Sol pour deux fois le prix
OpenAI introduit en parallèle un mode Fast pour GPT-5.6 Sol dans l’API. L’entreprise annonce une vitesse pouvant atteindre 2,5 fois celle du traitement Standard, facturée deux fois plus cher, sans changement d’intelligence du modèle. Le terme « jusqu’à » est important : il décrit un maximum revendiqué et non une garantie uniforme de temps de réponse pour chaque requête, région ou niveau de charge.
Fast remplace l’ancienne offre Priority Processing. Pour préserver la compatibilité, les requêtes API déjà marquées comme prioritaires doivent être automatiquement dirigées vers Fast. OpenAI rapproche aussi ce traitement de la commande `/fast` de Codex. L’alignement du nom et de l’objectif ne signifie toutefois pas que la facturation API et la consommation de crédits dans une interface par abonnement sont identiques.
Ce surcoût peut se justifier lorsque la latence bloque une opération coûteuse, un agent interactif ou une étape de production. Il est moins évident pour un traitement différé, un classement massif ou une automatisation nocturne. Un test pertinent doit mesurer le temps complet du workflow, pas seulement la vitesse instantanée de génération, car la navigation, les outils externes et les validations peuvent rester les principaux goulots d’étranglement.
Les abonnements ne baissent pas, mais Terra et Luna consomment moins de crédits
Terra et Luna restent disponibles dans ChatGPT Work, Codex et l’API. OpenAI indique que les utilisateurs Free et Go peuvent accéder à Terra, tandis que Plus, Pro, Business et Enterprise peuvent choisir Terra et Luna. Les prix d’abonnement et les enveloppes de quotas ne changent pas avec l’annonce. La baisse est répercutée par une consommation de crédits plus faible lorsqu’un service payant utilise Terra ou Luna.
Cette distinction évite une conclusion trompeuse : un abonné ne voit pas automatiquement sa mensualité diminuer de 80 %. Il peut en revanche réaliser davantage de travail dans la même enveloppe si le produit décompte effectivement moins de crédits. OpenAI ne fournit pas dans le billet une table universelle de conversion entre tokens API, crédits Codex et limites de ChatGPT, qui peuvent varier selon le plan et la fonction utilisée.

OpenAI annonçait aussi un déploiement des nouveaux prix sur AWS plus tard le 30 juillet. Cette disponibilité concerne l’intégration du fournisseur et peut ne pas être instantanée dans tous les comptes ou toutes les régions. Les entreprises doivent vérifier leur console, le nom exact du modèle et leur contrat plutôt que supposer que toute consommation historique ou tout service tiers est automatiquement refacturé au nouveau tarif.
Des gains d’efficacité revendiqués, mais encore non audités
OpenAI attribue la baisse à des améliorations du modèle, du routage, du logiciel de production et de la gestion de contexte. L’entreprise affirme que Sol a aidé, dans un processus dirigé par des humains, à réécrire des kernels de production. Ce travail aurait réduit de 20 % le coût de service de bout en bout, tandis que d’autres expériences auraient augmenté de plus de 15 % l’efficacité de génération des tokens.
Ces valeurs sont des mesures internes publiées par OpenAI. Aucun protocole complet, jeu de charges ou audit indépendant n’accompagne l’annonce. Elles ne prouvent pas que chaque application devient 20 % moins chère ou 15 % plus rapide. Les économies commerciales de Luna et Terra sont réelles au barème API, mais les explications techniques et les comparaisons de performance par dollar restent à vérifier sur des usages reproductibles.
Pour un développeur, la meilleure stratégie consiste à router les tâches par niveau de difficulté : Luna pour les volumes simples et bien spécifiés, Terra pour le travail général, Sol lorsque le coût d’une erreur justifie davantage de calcul. Ce découpage doit rester fondé sur des évaluations propres au produit. Un modèle moins cher peut coûter davantage s’il réclame plusieurs corrections, tandis qu’un modèle plus puissant peut être gaspillé sur une opération déterministe.



Commentaires
Chargement…
Préparation de votre espace lecteur…
Chargement des commentaires…