Veille IA Veille IA sans buzz : pour stratèges québécois.
La veille

GPT-5.6 Sol surpasse Claude Opus 5 sur ARC-AGI-3

GPT-5.6 Sol surpasse Claude Opus 5 sur ARC-AGI-3

2 min de lecture · The Decoder · Matthias Bastian · 30 juil. 2026 IA générative 8/10 Élevé
GPT-5.6 Sol surpasse Claude Opus 5 sur ARC-AGI-3

OpenAI démontre que GPT-5.6 Sol atteint 38,3% sur le benchmark ARC-AGI-3 avec ses paramètres API personnalisés, surpassant les 30,2% de Claude Opus 5. Cependant, le score officiel n'est que de 7,8% sans ces ajustements.

« GPT-5.6 Sol hits 38.3 percent with two API settings, beating Opus 5's 30.2 percent. » — The Decoder

Que faut-il retenir ?

  • GPT-5.6 Sol atteint 38,3% sur ARC-AGI-3 avec les paramètres API d'OpenAI.
  • Claude Opus 5 avait établi un record à 30,2% sur le même benchmark.
  • Le score officiel de GPT-5.6 Sol n'est que de 7,8% sans ajustements.
  • OpenAI utilise son propre environnement avec 'Retained Reasoning' et 'Compaction'.

Pourquoi cette nouvelle compte-t-elle ?

Ces résultats montrent l'importance de l'environnement de test dans l'évaluation des modèles d'IA. Les professionnels doivent considérer ces paramètres pour des comparaisons équitables entre modèles concurrents.

38,3% de score pour GPT-5.6 Sol avec les paramètres API personnalisés.

Public concerné : développeurs, entreprises

Pourquoi les scores de GPT-5.6 Sol varient-ils autant selon l'environnement de test ?

Les scores varient car OpenAI utilise des paramètres API personnalisés comme 'Retained Reasoning' et 'Compaction', absents dans le test officiel. Ces fonctionnalités améliorent significativement les performances du modèle.

🔧 Outils mentionnés

🔐 Connexion rapide

Entrez votre courriel pour recevoir un code à 6 chiffres.

Pas besoin de mot de passe ni d'inscription. Entrez votre courriel, recevez un code par courriel, et c'est tout !