Aller au contenu principal

GPT-5.6 Sol, Terra et Luna en disponibilité générale depuis le 9 juillet : les benchmarks de production et la logique coût-performance qui tranche entre les trois niveaux

GPT-5.6 est en disponibilité générale depuis le 9 juillet 2026. Jusqu'à cette date, seules une vingtaine d'organisations partenaires avaient accès à Sol, Terra et Luna dans le cadre d'une preview restreinte ouverte le 28 juin. Depuis le 9 juillet, tout développeur disposant d'un compte OpenAI API actif peut appeler les trois variantes sans liste d'attente ni validation préalable.

Cet article fait suite à notre analyse du 28 juin consacrée aux annonces de la preview — voir GPT-5.6 Sol, Terra et Luna en preview restreint. Dix jours de production livrent désormais ce que la preview ne pouvait pas fournir : les benchmarks publiés par OpenAI, les retours des premiers utilisateurs sur les trois niveaux, et un calcul de coût réel qui permet d'arbitrer.

La conclusion directe, détaillée dans ce guide : Terra à 2,50 $/M de tokens en entrée est le choix par défaut rationnel pour la majorité des agents d'entreprise. Sol à 5 $/M se justifie pour un sous-ensemble restreint de tâches à très haute complexité. Luna à 1 $/M s'impose sur les volumes élevés à raisonnement limité. Ce qui suit détaille les benchmarks, le calcul de coût concret, et la grille d'arbitrage pour vos workflows en production.

De la preview restreinte à la disponibilité générale

Réponse directe : le passage en GA du 9 juillet ouvre GPT-5.6 à tous les développeurs API et introduit une fonctionnalité absente de la preview : les cache breakpoints. Les tarifs annoncés en juin sont confirmés sans modification.

Trente-six jours séparent l'annonce publique initiale de GPT-5.6 — lors de la Spring Update OpenAI fin mai 2026 — de la disponibilité générale du 9 juillet. La phase de preview restreinte, du 28 juin au 8 juillet inclus, a duré treize jours et a bénéficié à une vingtaine d'organisations partenaires pour des tests en conditions réelles.

Le passage en GA a introduit trois changements concrets :

  • Accès universel : tout développeur avec un compte API OpenAI actif peut désormais appeler gpt-5-6-sol, gpt-5-6-terra et gpt-5-6-luna via l'API standard, sans démarche supplémentaire.
  • Tarifs publics confirmés : Sol à 5 $/M input / 30 $/M output, Terra à 2,50 $/M / 15 $/M, Luna à 1 $/M / 6 $/M — les prix annoncés en preview s'appliquent sans modification à la GA.
  • Cache breakpoints : fonctionnalité nouvelle disponible uniquement à partir du 9 juillet, permettant de contrôler manuellement les points de découpe dans le cache de prompt, absent des générations précédentes et des variantes disponibles en preview.

Les capacités fondamentales restent inchangées par rapport aux annonces : fenêtre de contexte d'un million de tokens pour les trois niveaux, date de coupure de connaissance au 1er février 2026, support du tool calling, de l'orchestration multi-agents et du streaming. Pour une analyse de ChatGPT Work, l'agent autonome lancé le même jour, voir notre article dédié au lancement de ChatGPT Work.

Sol, Terra et Luna : les trois configurations confirmées

Réponse directe : GPT-5.6 est une famille de trois modèles distincts partageant la même interface API. Sol est le niveau flagship (5 $/M input), Terra le niveau intermédiaire (2,50 $/M), Luna le niveau économique (1 $/M). Les trois partagent 1 million de tokens de contexte.

La structure telle que confirmée par OpenAI lors du passage en GA :

  • GPT-5.6 Sol — Tarif : 5 $/M tokens input, 30 $/M tokens output. Conçu pour les tâches de raisonnement complexe, la recherche en sécurité, l'analyse juridique ou financière approfondie et les workflows agents de longue durée où la précision prime. Sol est le moteur utilisé par ChatGPT Work pour les tâches autonomes multi-heures.
  • GPT-5.6 Terra — Tarif : 2,50 $/M input / 15 $/M output. Positionné par OpenAI comme offrant des performances proches de Sol sur les benchmarks de code et de raisonnement à la moitié du coût. Terra cible les pipelines agents en production, la génération de code, l'analyse de documents structurés et les traitements métier répétitifs.
  • GPT-5.6 Luna — Tarif : 1 $/M input / 6 $/M output. Optimisé pour les volumes élevés, la classification, l'extraction d'informations, le routage de requêtes et les interfaces conversationnelles simples. La latence de Luna est la plus basse des trois variantes.

Une migration de Sol vers Terra ou Luna ne nécessite que la modification du paramètre model dans l'appel API — le reste du code reste identique. La fenêtre de contexte d'un million de tokens est disponible sur les trois niveaux, ce qui représente un changement notable par rapport à GPT-5.5 où le contexte étendu était réservé aux variantes premium.

Benchmarks de production : ce que confirment dix jours de données

Réponse directe : les benchmarks publiés par OpenAI lors de la GA montrent que Terra atteint 87,4 % sur Terminal-Bench 2.1 contre 88,8 % pour Sol — un écart de 1,4 point pour un coût deux fois inférieur. Sur SWE-Bench Pro (résolution de tickets GitHub réels), l'écart est similaire : 63,4 % pour Terra contre 64,6 % pour Sol.

Terminal-Bench 2.1

Ce benchmark évalue la capacité à effectuer des tâches complexes dans un environnement terminal : installation de dépendances, débogage de scripts, navigation dans des systèmes de fichiers, exécution de commandes chaînées. Selon les données publiées par OpenAI au lancement, Sol atteint 88,8 % et Terra 87,4 %. Pour la plupart des workflows DevOps et de développement sur mesure, les deux niveaux sont pratiquement indiscernables sur ce type de tâche.

SWE-Bench Pro

SWE-Bench Pro mesure la résolution autonome de vrais tickets GitHub dans des codebases réels, sans contexte artificiel. Sol atteint 64,6 %, Terra 63,4 % selon les chiffres publiés par OpenAI. L'écart de 1,2 point est statistiquement faible. Résoudre plus de 63 % de tickets réels représente un niveau de performance très élevé pour les agents de code en production.

ExploitBench2

Ce benchmark de sécurité évalue la capacité à identifier et exploiter des vulnérabilités documentées dans des environnements contrôlés. Sol atteint 73,5 % selon les données publiées au lancement, contre 47,9 % pour la génération précédente sur un benchmark comparable. Cet écart confirme un saut générationnel significatif pour les équipes pratiquant le red-teaming ou l'analyse de code critique. Luna n'est pas positionné sur ce type de tâche.

Note méthodologique : ces chiffres sont issus des données publiées par OpenAI au moment du lancement GA et des analyses publiées dans les jours suivants. Ils reflètent les capacités déclarées à la date de publication, non des mesures indépendantes.

Calcul de coût réel par volume et cas d'usage

Réponse directe : sur un volume typique de 5 000 requêtes/jour avec 2 000 tokens en entrée et 500 en sortie, Luna coûte ~750 $/mois, Terra ~1 875 $/mois et Sol ~3 750 $/mois. L'écart entre Luna et Sol dépasse 30 000 $/mois pour 50 000 requêtes/jour.

Prenons un cas d'automatisation métier type : un agent traitant des emails entrants ou des demandes clients avec en moyenne 2 000 tokens en entrée et 500 tokens en sortie.

  • Luna (1 $/M input / 6 $/M output) : (5 000 × 2 000 / 1 000 000) × 1 + (5 000 × 500 / 1 000 000) × 6 = 10 + 15 = 25 $/jour, soit ~750 $/mois.
  • Terra (2,50 $/M / 15 $/M) : 25 + 37,5 = 62,50 $/jour, soit ~1 875 $/mois.
  • Sol (5 $/M / 30 $/M) : 50 + 75 = 125 $/jour, soit ~3 750 $/mois.

Pour 50 000 requêtes/jour — volume typique d'un outil interne sur mesure traitant des commandes ou des documents à flux continu — l'écart mensuel entre Luna et Sol dépasse 30 000 $. La décision de niveau devient alors une décision financière significative, pas seulement technique.

Point à noter sur la comparaison avec GPT-5.5 : GPT-5.5 était tarifé à 2 $/M input. Terra à 2,50 $/M représente une augmentation de 25 % sur les tokens d'entrée, partiellement compensée par un surcoût plus modeste sur les tokens de sortie selon votre profil d'usage. La migration de GPT-5.5 vers Terra se justifie si les améliorations de capacités — contexte 1M tokens, benchmarks supérieurs, knowledge cutoff plus récent — réduisent le taux d'erreur ou le nombre de reprises dans votre pipeline. Pour comparer avec d'autres fournisseurs, voir notre comparatif des modèles IA 2026 par usage métier.

Cache breakpoints : la nouveauté sous-estimée du lancement GA

Réponse directe : les cache breakpoints permettent de spécifier manuellement dans l'appel API où le cache de prompt doit se découper, rendant les coûts de mise en cache prévisibles. C'est une fonctionnalité absente des générations précédentes, disponible uniquement depuis le passage en GA du 9 juillet.

Dans les modèles OpenAI antérieurs, la mise en cache du prompt (prompt caching) s'appliquait automatiquement selon des règles internes : difficile à anticiper, donc difficile à optimiser dans un budget mensuel. Avec GPT-5.6, les développeurs peuvent insérer des marqueurs explicites dans la requête API pour indiquer les points de séparation du cache.

Ce que cela change concrètement :

  • Le contexte système stable — instructions métier, règles de traitement, documentation produit, mémoire longue — peut être mis en cache de façon fiable à un coût réduit.
  • La partie variable de chaque requête (la question de l'utilisateur, les données fraîches, les résultats d'outils) est traitée au tarif plein mais sur un volume bien plus faible.
  • Les coûts de cache deviennent prévisibles et budgétisables mois par mois.

Pour un outil interne sur mesure utilisant un long contexte système constant — mémoire cliente, historique de session, documentation réglementaire — les cache breakpoints peuvent réduire le coût effectif de 30 à 50 % selon la proportion de tokens stables réutilisés entre les requêtes. La mise en place nécessite une modification minimale du code d'appel API et aucune infrastructure supplémentaire.

Grille de décision : Sol, Terra ou Luna selon votre usage

Réponse directe : Terra est le choix par défaut pour la majorité des agents métier en production. Luna s'impose dès que le volume dépasse 30 000 requêtes/jour sur des tâches simples. Sol se justifie uniquement pour les tâches de sécurité avancée ou d'analyse complexe où chaque erreur a un coût métier direct.

Choisir Luna si :

  • Volume élevé (plus de 30 000 requêtes/jour) avec tâches structurées : classification, extraction de champs, résumé court, routage de demandes.
  • Latence critique : Luna est la variante la plus rapide des trois, pertinente pour les interfaces en temps réel.
  • Chatbot FAQ ou assistant de premier niveau alimenté par une base de connaissance bien structurée.
  • Budget strict inférieur à 500 $/mois pour un volume de moins de 5M tokens de sortie par mois.

Choisir Terra si :

  • Agent de production nécessitant un raisonnement multi-étapes : analyse de contrats, traitement de commandes complexes, génération de code, extraction structurée depuis des documents longs.
  • Migration depuis GPT-5.5 avec besoin d'un contexte plus large : Terra offre 1M tokens natif là où GPT-5.5 était limité sur les contextes très longs.
  • La quasi-parité avec Sol sur Terminal-Bench 2.1 et SWE-Bench Pro rend Terra rationnel pour 80 % des tâches de développement et d'automatisation courantes.
  • Workflows hybrides où Sol est réservé à un sous-ensemble de tâches sensibles — Terra peut traiter le volume principal en parallèle.

Choisir Sol si :

  • Tâches de sécurité avancée, red-teaming, analyse de vulnérabilités : ExploitBench2 confirme une avance mesurable de Sol sur ces cas.
  • Raisonnement juridique ou financier de haute précision où une erreur a un coût direct (contrats, due diligence, analyse réglementaire).
  • Volume faible sur des tâches très longues et complexes combinant plusieurs sources hétérogènes sur plus de 500 000 tokens.

Pour un accompagnement sur l'architecture de vos agents et le choix de niveau selon vos contraintes budgétaires, consultez notre page de contact.

FAQ — GPT-5.6 Sol, Terra et Luna en disponibilité générale depuis le 9 juillet : les benchmarks de production et la logique coût-performance qui tranche entre les trois niveaux

GPT-5.6 Terra offre-t-il vraiment les mêmes performances que Sol sur les tâches de code ?

Sur les benchmarks publiés par OpenAI lors de la GA (Terminal-Bench 2.1 et SWE-Bench Pro), l'écart entre Terra et Sol est de 1,2 à 1,4 point de pourcentage. En pratique, pour la génération de code, le débogage et la résolution de tickets GitHub, cet écart est rarement perceptible sur des tâches standard. Sol conserve un avantage mesurable sur les tâches de sécurité avancée (ExploitBench2) et les raisonnements très longs et complexes.

Comment activer les cache breakpoints avec GPT-5.6 dans une requête API ?

Les cache breakpoints s'activent via un paramètre spécifique dans la structure de la requête API OpenAI, selon la documentation disponible sur platform.openai.com. Le principe consiste à marquer les blocs de tokens stables (contexte système, mémoire longue) en les séparant des tokens variables (requête utilisateur, données fraîches) afin que le cache s'applique uniquement à la portion stable. Aucune infrastructure supplémentaire n'est nécessaire — la modification se fait au niveau du code d'appel.

La fenêtre de contexte d'un million de tokens est-elle vraiment disponible sur Luna ?

Oui, selon les informations publiées par OpenAI lors du passage en GA, les trois variantes — Sol, Terra et Luna — partagent la même fenêtre de contexte d'un million de tokens. C'est une différence notable par rapport aux architectures précédentes où le contexte étendu était réservé aux niveaux supérieurs. Luna peut donc traiter de longs documents ou historiques de conversation, bien que son positionnement pour les tâches complexes longues reste inférieur à Terra et Sol.

Quelle est la date de coupure de connaissance (knowledge cutoff) de GPT-5.6 ?

Selon les informations publiées par OpenAI au lancement, la date de coupure de connaissance de GPT-5.6 (Sol, Terra et Luna) est le 1er février 2026. Les événements postérieurs à cette date ne sont pas intégrés dans les poids du modèle de base, mais peuvent être compensés par l'ajout de contexte via le prompt, par des outils de recherche web, ou par un accès aux données en temps réel via l'API.

Faut-il migrer de GPT-5.5 vers Terra ou peut-on rester sur GPT-5.5 ?

GPT-5.5 reste disponible sur l'API OpenAI et n'est pas encore déprécié selon les informations disponibles fin juillet 2026. Le passage à Terra (2,50 $/M input contre 2 $/M pour GPT-5.5) représente un surcoût d'environ 25 % sur les tokens d'entrée. La migration se justifie si votre usage nécessite un contexte au-delà de la limite de GPT-5.5, si les benchmarks de Terra sur votre cas d'usage sont mesurables, ou si la date de coupure plus récente (février 2026) est importante pour vos données.

Sources