Aller au contenu principal

GPT-6 Astra sur ARC-AGI-3 : 99,9 % ou 62,7 % selon le harness — décryptage d'un écart de 37 points pour acheteurs IA

Depuis le lancement de GPT-6 Astra le 3 septembre 2026, deux chiffres circulent simultanément : 99,9 % et 62,7 % sur ARC-AGI-3, le benchmark de référence pour mesurer le raisonnement abstrait des modèles IA. Même modèle, même batterie de tests, mais deux résultats radicalement différents selon les conditions d'évaluation.

Cette divergence n'est pas une erreur ni une manipulation. Elle résulte de deux méthodes de test distinctes — ce que les chercheurs appellent des « harness » — et l'ARC Prize, l'organisation indépendante qui gère ce benchmark, a publié les deux résultats en toute transparence. Comprendre pourquoi cet écart existe est désormais une compétence essentielle pour quiconque prend des décisions d'investissement IA dans une organisation.

Cet article décrypte la différence entre les deux harness, explique ce que le 62,7 % signifie réellement pour comparer les modèles, et propose une méthode concrète pour lire n'importe quel benchmark IA sans se faire piéger par un chiffre sorti de son contexte. Les faits présentés ici sont vérifiés par plusieurs sources indépendantes, dont les pages officielles d'ARC Prize.

Deux scores pour le même modèle : d'où vient l'écart ?

GPT-6 Astra a été évalué sur ARC-AGI-3 dans deux configurations distinctes, toutes deux soumises par OpenAI à l'ARC Prize :

  • Score standard (62,7 %) : GPT-6 Astra utilise une interface provider-neutre, identique pour tous les modèles en compétition. Le modèle a obtenu 62,7 % au coût de 26 098 dollars pour l'ensemble du jeu de test semi-privé. C'est ce score qui sert de référence pour les comparaisons inter-modèles.
  • Score fournisseur (99,9 %) : OpenAI a soumis en parallèle un résultat utilisant son propre « provider adapter harness », qui permet au modèle de préserver un état de raisonnement opaque entre les requêtes et d'utiliser un mécanisme de compaction pour les conversations longues. Dans cette configuration, GPT-6 Astra a atteint 99,9 % au coût de 18 817 dollars.

Les deux scores sont réels, mesurés sur des tâches identiques. La différence tient entièrement à la façon dont le raisonnement intermédiaire du modèle est géré entre les appels. L'ARC Prize a choisi de publier les deux résultats, avec la documentation complète de chaque protocole — un choix de transparence exemplaire dans le secteur.

En pratique, lorsqu'un fournisseur publie un score « record », la première question à poser est : quel harness a été utilisé ?

Harness standard vs harness fournisseur : ce que ça change

Le terme « harness » désigne le cadre technique qui orchestre l'évaluation : comment le modèle reçoit les problèmes, dans quel ordre, et comment son contexte est maintenu entre les tentatives de résolution.

Le harness standard : conditions équitables pour tous

Le harness standard d'ARC Prize impose les mêmes règles à tous les modèles, quel que soit leur fournisseur. Le modèle reçoit les problèmes via une interface neutre, et son état de raisonnement visible est géré de façon uniforme entre les tentatives. C'est l'équivalent d'un examen où chaque candidat dispose exactement du même brouillon, du même temps, et des mêmes outils. Ce protocole garantit la comparabilité des scores.

Le harness fournisseur : l'avantage de la mémoire opaque

Le harness fournisseur (ou « provider adapter harness ») exploite une capacité spécifique de GPT-6 Astra : la préservation d'un état de raisonnement opaque entre les requêtes. Concrètement, le modèle peut mémoriser et réutiliser ses raisonnements intermédiaires d'un problème à l'autre, même si ces raisonnements ne sont pas visibles dans la réponse finale. Il bénéficie également d'un mécanisme de compaction qui compresse les conversations longues sans perdre le contexte utile.

Cet avantage est documenté et réel. Mais il n'est pas reproductible de la même façon pour les modèles d'autres fournisseurs, qui n'ont pas accès à cette interface propriétaire d'OpenAI. Comparer directement un 99,9 % (harness OpenAI) avec un 30 % (harness standard, autre modèle) serait donc une erreur méthodologique.

Pourquoi l'ARC Prize a publié les deux — et ce que ça signifie

L'ARC Prize aurait pu n'afficher que le score standard et rejeter le harness fournisseur. En publiant les deux avec une explication claire, l'organisation établit un précédent utile : les meilleures évaluations exposent leur méthodologie plutôt que d'imposer un seul chiffre sans contexte. Pour les acheteurs et décideurs IA, cela pose une nouvelle exigence de lecture : un score sans précision du harness est un score incomplet.

Le classement ARC-AGI-3 au 4 septembre 2026

En utilisant le harness standard (seule base de comparaison valide entre modèles de fournisseurs différents), le classement ARC-AGI-3 au 4 septembre 2026 est le suivant :

  1. GPT-6 Astra (OpenAI) : 62,7 % — coût de la session : 26 098 $
  2. Claude Opus 5 (Anthropic) : 30,2 %
  3. GPT-5.6 Sol (OpenAI) : 7,8 %

Cet écart entre GPT-6 Astra (62,7 %) et le deuxième modèle (Claude Opus 5, 30,2 %) est considérable — plus de 30 points. Il confirme que GPT-6 Astra représente un saut qualitatif significatif sur les tâches de raisonnement abstrait, indépendamment des questions de harness.

À titre de repère, la performance humaine de référence sur ARC-AGI-3 est estimée à environ 85 %. GPT-6 Astra sous harness standard atteint donc environ 74 % de cette performance — une avancée substantielle, mais pas encore au niveau humain dans des conditions d'évaluation uniformes.

Ce classement est partiel : tous les grands fournisseurs n'ont pas encore soumis leurs modèles à ARC-AGI-3. Les positions évolueront dans les prochaines semaines, en particulier si Anthropic soumet Claude Opus 5 au format semi-privé ou si Google publie des résultats Gemini 3.1 Pro sur ce benchmark.

Tarification et accès pour les entreprises

OpenAI a publié les conditions tarifaires de GPT-6 Astra pour l'API :

  • 10 $ par million de tokens en entrée
  • 50 $ par million de tokens en sortie

Pour contextualiser : une session intensive comme celle utilisée pour ARC-AGI-3 (26 000 $ pour l'intégralité du jeu de test) est hors de portée d'une utilisation quotidienne standard. En revanche, pour des cas d'usage ciblés — analyse de documents complexes, génération de code sur des architectures avancées, raisonnement sur des ensembles de données structurées — le coût par requête reste maîtrisable selon le volume.

Pour comparaison, Claude Opus 5 (Anthropic) se positionne à des niveaux tarifaires similaires pour les tâches de raisonnement avancé, et GPT-5.6 Sol d'OpenAI était facturé 5 $/M de tokens en entrée. GPT-6 Astra est donc deux fois plus cher en entrée et dix fois plus en sortie que Sol — un différentiel justifié selon OpenAI par ses capacités de raisonnement sensiblement supérieures.

Modalités de déploiement

L'accès à GPT-6 Astra se déploie progressivement :

  • En priorité pour les organisations participant au programme Daybreak (cybersécurité)
  • Puis pour ChatGPT Plus, Pro, Business et Enterprise
  • Via l'API OpenAI, Microsoft Azure et AWS Bedrock

Point technique pour les équipes IT : l'accès enterprise est désactivé par défaut et doit être activé explicitement par un administrateur. Pour les projets d'automatisation métier ou d'outils internes sur mesure intégrant GPT-6 Astra, anticipez cette étape d'activation administrative dans le planning de déploiement.

Méthode pratique pour lire un benchmark IA

L'histoire du double score de GPT-6 Astra illustre une réalité plus large : les benchmarks IA sont de plus en plus complexes à interpréter sans connaître leur contexte d'exécution. Voici une méthode pratique en quatre questions pour éviter les pièges les plus courants lors d'un choix de modèle.

Question 1 — Quel harness a été utilisé ?

Harness neutre ou harness fournisseur ? Si c'est un harness propriétaire, le score ne peut pas être comparé directement aux autres modèles. Cherchez la mention « standard harness » ou équivalent dans la documentation de l'évaluation.

Question 2 — Quel était le coût de la session d'évaluation ?

Un score obtenu pour 26 000 $ de calcul n'est pas transposable à un usage quotidien de 5 $ de tokens. Le coût par tâche est aussi important que la performance brute. Un modèle légèrement moins performant mais dix fois moins cher peut être le bon choix pour 90 % de vos cas d'usage.

Question 3 — Sur quel jeu de test : public ou semi-privé ?

Les scores sur les jeux semi-privés (comme la partie semi-privée d'ARC-AGI-3) sont structurellement plus fiables. Sur les benchmarks entièrement publics, les modèles peuvent avoir été optimisés — parfois indirectement — sur les exemples disponibles, ce qui gonfle les scores sans refléter la performance réelle sur de nouveaux problèmes.

Question 4 — Qui a réalisé l'évaluation ?

Une évaluation tierce indépendante (ARC Prize, LMSYS, etc.) est structurellement plus fiable qu'un score publié directement par le fournisseur sans protocole neutre. Cela ne signifie pas qu'un fournisseur mente — cela signifie que les conditions d'évaluation internes ne sont pas nécessairement comparables aux conditions d'évaluation neutres.

Ce que les benchmarks généraux ne mesurent pas

Les benchmarks comme ARC-AGI-3 évaluent le raisonnement abstrait. Ils ne mesurent pas : la fiabilité en production sur vos données spécifiques, la cohérence sur des tâches répétitives à grande échelle, la latence dans des conditions réseau réelles, ni la capacité à suivre des instructions nuancées dans votre domaine métier. Pour évaluer un modèle avant de l'intégrer à un projet concret, une phase de développement sur mesure avec vos propres jeux de données tests reste irremplaçable.

FAQ — GPT-6 Astra sur ARC-AGI-3 : 99,9 % ou 62,7 % selon le harness — décryptage d'un écart de 37 points pour acheteurs IA

GPT-6 Astra a-t-il vraiment obtenu 99,9 % sur ARC-AGI-3 ?

Oui, mais dans des conditions spécifiques. Ce score a été obtenu avec le harness fournisseur d'OpenAI, qui préserve l'état de raisonnement opaque du modèle entre les requêtes — une capacité non disponible aux autres modèles dans le même format. Avec le harness standard neutre utilisé pour toutes les comparaisons inter-modèles, GPT-6 Astra a obtenu 62,7 %, ce qui reste un record sur ARC-AGI-3.

Pourquoi comparer le score 62,7 % et non le 99,9 % avec les autres modèles ?

Parce que le harness standard impose les mêmes règles à tous les modèles, quelle que soit leur architecture. Comparer un score obtenu sous harness fournisseur d'un modèle avec un score standard d'un autre modèle équivaut à comparer des performances mesurées dans des conditions fondamentalement différentes — la comparaison n'est alors pas valide méthodologiquement.

Quel est le prix de GPT-6 Astra via l'API OpenAI ?

OpenAI a fixé le tarif API à 10 dollars par million de tokens en entrée et 50 dollars par million de tokens en sortie. L'accès se déploie progressivement : d'abord pour les participants au programme Daybreak, puis pour les abonnés ChatGPT Plus, Pro, Business et Enterprise, ainsi que via Azure et AWS Bedrock.

GPT-6 Astra surpasse-t-il les capacités humaines sur ARC-AGI-3 ?

Pas encore, dans les conditions d'évaluation comparables. La performance humaine de référence sur ARC-AGI-3 est estimée à environ 85 %. GPT-6 Astra obtient 62,7 % sous harness standard, soit environ 74 % de la performance humaine. Le 99,9 % sous harness fournisseur se rapproche des performances humaines, mais dans des conditions non directement comparables.

Comment savoir si GPT-6 Astra convient à mes cas d'usage métier ?

GPT-6 Astra excelle sur le raisonnement complexe, le code avancé, les workflows agentiques longs et les tâches nécessitant une capacité de planification étendue. Pour des tâches standard (génération de texte, analyse documentaire simple, classification), des modèles moins coûteux offrent un meilleur rapport coût/performance. Une évaluation sur vos données et processus réels reste la seule façon de trancher pour votre contexte spécifique.

Sources