Cours
Actualisation : depuis la publication de cet article, OpenAI a sorti plusieurs nouveaux modèles. Pour rester à jour, consultez aussi nos guides sur GPT-5.4, GPT-5.3-Codex et GPT-5.3-Instant.
À peine un mois s’est écoulé depuis le lancement de GPT-5.1. Mais un mois, c’est long dans le monde de l’IA. Entre-temps, Google a publié Gemini 3, qui a pris la tête de la plupart des benchmarks les plus suivis, et Antropic a lancé Claude Opus 4.5, qui a de nouveau dominé le classement en ingénierie logicielle.
OpenAI tient à s’affirmer comme l’entreprise la mieux placée pour délivrer de la valeur aux organisations. Mais après avoir reculé sur des classements clés, la société a pu craindre de perdre des utilisateurs, voire des clients grands comptes. D’après plusieurs sources, cette pression a déclenché un « code rouge » et poussé l’équipe à accélérer la sortie de GPT-5.2.
Dans cet article, je vous aide à décrypter tout ce qui accompagne la sortie de GPT-5.2, y compris ce que les entreprises peuvent en attendre avec trois nouveaux modèles, en cours de déploiement dans ChatGPT pour tous les abonnés payants (et désormais disponibles via l’API). Vous pouvez aussi consulter notre guide de l’outil ChatGPT Images ainsi que ceux consacrés aux deux modèles plus récents, GPT-5.3 Codex et GPT-5.2 Instant.
Nous tenons nos lecteurs informés des dernières avancées en IA via The Median, notre newsletter gratuite du vendredi qui décortique les infos essentielles de la semaine. Abonnez-vous et restez affûté en quelques minutes :
Quoi de neuf dans GPT-5.2 ?
GPT-5.2 apporte des améliorations ciblées en raisonnement, mémoire et utilisation d’outils. Dans la logique d’OpenAI, ces avancées se traduisent par des workflows d’entreprise plus fluides et moins de points de défaillance au quotidien. Chacun des trois modèles de la série propose une approche différente pour délivrer cette valeur.
GPT‑5.2 Instant
GPT-5.2 Instant privilégie une latence minimale et des réponses très rapides. C’est le cheval de bataille du quotidien pour s’informer, rédiger et traduire. C’est le modèle avec lequel la plupart des utilisateurs interagiront par défaut, et son atout, c’est le débit plutôt que la profondeur. Concrètement, il comble le besoin de réponses rapides ou d’automatisations légères sans payer le coût d’un raisonnement plus lourd.
GPT‑5.2 Thinking
GPT-5.2 Thinking intègre des capacités de raisonnement étendu qui lui permettent de dérouler pas à pas des problèmes complexes avant de répondre.
Sur les benchmarks d’OpenAI, c’est le modèle qui établit de nouveaux sommets sur les tâches de knowledge work, de codage et de long contexte, surtout lorsqu’il peut utiliser des outils comme des feuilles de calcul et des présentations.
C’est la tentative d’OpenAI de créer un moteur généraliste pour le travail de connaissance, et c’est le modèle à choisir quand la précision gagne à réfléchir de manière délibérée. Pour beaucoup d’organisations, ce sera l’option privilégiée pour l’analyse, les workflows multi-étapes et les tâches agentiques.
GPT‑5.2 Pro
C’est le porte-étendard, conçu en priorité pour les clients entreprise.
C’est aussi l’option la plus onéreuse, car elle vise les scénarios à forts enjeux, où des gains incrémentaux en qualité de raisonnement, exactitude factuelle et résolution de problèmes abstraits justifient un coût par token plus élevé.
Pro est destiné aux environnements où l’erreur coûte cher, et où les équipes ont besoin d’un modèle capable de rester cohérent sur des contextes très longs. C’est le modèle à utiliser pour les systèmes d’aide à la décision, la planification complexe et toute charge de travail où la fiabilité compte autant que la puissance brute.
Quand GPT-5.2 est-il disponible ?
GPT-5.2 est déjà en cours de déploiement. OpenAI a officiellement lancé le modèle le 11 décembre 2025, avec un accès prioritaire pour les forfaits payants ChatGPT, puis une disponibilité qui s’étend progressivement selon les régions et les plateformes. Les utilisateurs peuvent accéder aux trois modèles GPT-5.2 directement dans ChatGPT, et les développeurs peuvent les utiliser via l’API d’OpenAI depuis les endpoints Responses et Chat Completions.
Benchmarks de GPT-5.2
La sortie de GPT 5.1 était remarquablement avare en résultats de benchmark car elle se concentrait sur l’expérience utilisateur. Sans surprise, GPT 5.2 cherche à redresser la barre en mettant davantage l’accent sur les performances.
Tâches professionnelles
GDPval est le benchmark le plus mis en avant dans cette nouvelle version. Mais il n’a été présenté sur arXiv qu’au début d’octobre 2025, ce qui en dit long sur la nature de cette sortie.
GDPval évalue des tâches que les professionnels réalisent au quotidien, comme construire des rapports et préparer des présentations. Les questions proviennent de 44 métiers issus des neuf principaux secteurs contribuant au PIB américain. Cela va de l’infirmier au data scientist en passant par l’enseignant-chercheur. Les tâches exigent de véritables livrables : feuilles de calcul, journaux comptables, vidéos et présentations.
Code
Le deuxième benchmark le plus mis en avant est SWE-Bench Pro, une évaluation exigeante d’ingénierie logicielle sur laquelle GPT-5.2 a obtenu 55,6 %. SWE-Bench Pro demande de résoudre des problèmes à long horizon extraits de vrais dépôts, impliquant par exemple des modifications sur plusieurs fichiers.
Vous avez peut-être entendu parler de SWE-bench Verified, une version plus facile du test. Sur celui-ci, GPT 5.2 a obtenu 80 %. Pour situer, nous avons récemment rapporté que Claude Opus 4.5 atteint 80,9 % sur ce test, ce qui rend les deux modèles globalement comparables.
Raisonnement long-contexte
GPT 5.2 affiche d’excellents résultats sur un autre benchmark, MRCR v2 (Multi-Round Coreference Resolution, version 2). Il flirte avec le score parfait, ce qu’OpenAI interprète comme un signal fort pour l’exploitation de documents très longs avec GPT 5.2.
Il atteint presque la perfection jusqu’à 256 k tokens. Cela représente environ deux cent mille mots, soit la taille d’un roman.
Exemples GPT-5.2 : mise à l’épreuve des nouvelles capacités
OpenAI affirme avec assurance que GPT 5.2 apporte de grands progrès en intelligence, compréhension de longs contextes, appels d’outils agentiques et vision. Évaluons-les tour à tour.
Compréhension long-contexte
Pour tester la compréhension long-contexte de GPT-5.2, j’ai importé une version en ligne du roman de J. M. Coetzee, Disgrace. Je lui ai ensuite demandé un petit détail, anecdotique et facile à oublier, enfoui dans un long passage.
Voici la question que j’ai posée à GPT-5.2 :
What did David serve Melanie for supper in one of their early encounters?
GPT-5.2 a trouvé la bonne réponse, alors que cela ressemblait pour moi à une aiguille dans une botte de foin. Ce dîner n’est mentionné qu’une fois dans le livre et n’a aucune importance narrative.
Ce test m’a montré que la restitution de GPT-5.2 ne repose pas sur des conjectures de motifs, mais sur une véritable rétention à travers une longue séquence.
Ce type de rétention est clé, car la vraie performance en long contexte tient à la capacité à maintenir un état précis sur de vastes volumes de texte. Si un modèle se souvient d’une recette de dîner ponctuelle, enfouie au cœur d’un récit de 90 pages, il peut aussi suivre des variables dans un codebase, des clauses dans un contrat ou des détails financiers dans un rapport de 200 pages.
Appels d’outils agentiques
Test 1
Pour évaluer les capacités agentiques de GPT-5.2, je lui ai confié une tâche nécessitant navigation et clics. Je lui ai demandé d’agir comme un agent autonome de recherche d’appartement. Utile pour celles et ceux qui souhaitent déménager, mais n’ont pas le temps d’éplucher les sites d’annonces.
Le modèle devait utiliser un navigateur, appliquer des filtres, ouvrir des annonces, extraire des informations et assembler un comparatif.
Voici l’essence du prompt :
You are my autonomous apartment-hunting agent.
Find apartments for rent in Queens.
Open a rental site, apply a price and neighborhood filter, scroll through the results,
click into each relevant listing, and extract structured details (price, address,
beds/baths, square footage, amenities, pet policy, parking, fees, lease terms, and a
short description of the layout/photos).
Then assemble everything into a table, rank the units by overall value, and write a brief
report naming the best-value pick, the cheapest acceptable unit, and the one with the
best amenities. Save the table as a CSV in the VM and show the ranked table in chat.
Ce setup visait à tester en une fois le raisonnement à long horizon, l’appel d’outils et l’interaction UI.
GPT-5.2 a navigué vers un site d’annonces, défini les filtres et parcouru les résultats de façon autonome. Il a ouvert des logements, extrait des champs structurés, choisi à la fois un quartier et une fourchette de prix (j’aurais pu imposer ces filtres, mais je ne cherche pas réellement à déménager), puis il a compilé une courte liste classée.
Je suis certain que la recherche n’était pas parfaite. En consultant la trace du modèle, j’ai vu que certains sites bloquaient le scraping, mais l’agent a su se rétablir en changeant de site et, au final, il a livré une sélection exploitable.
Un point agaçant dans le tableau final : le modèle ne m’a pas fourni de vraies URL, mais des références de type capture d’écran. La plupart des sites de location bloquent l’accès automatisé, et l’outil de navigation n’est pas autorisé à extraire ou partager les liens des annonces. Dans ce cas, il insère simplement un pointeur vers la capture prise dans le bac à sable. Un peu frustrant, donc.
Test 2
Je voulais tester jusqu’où s’étendent ces capacités agentiques dans un domaine avec beaucoup moins de sources propres, j’ai donc tenté une seconde expérience en généalogie.
J’ai demandé à GPT-5.2 d’examiner la présence du patronyme Waples dans les registres paroissiaux anglais et de vérifier un éventuel lien historique ou généalogique avec le Herefordshire.
GPT-5.2 a entrepris des actions concrètes, comme accéder à un site gratuit de généalogie et cliquer à travers les pages pour trouver et télécharger des actes.
Le modèle a décomposé le problème en sous-tâches, effectué des recherches sur des ressources comme FreeBMD et Forebears, et même rédigé un email de demande ciblée pour accéder à des archives non numérisées.
En parallèle, j’ai constaté que la généalogie impose des limites structurelles. Beaucoup de sources clés – registres paroissiaux, rouleaux de présentation – n’existent que dans des archives ou derrière des catalogues restreints. FreeBMD limite à 50 enregistrements par téléchargement, le catalogue du HARC n’est pas accessible sans cookies de session, et les documents pertinents s’obtiennent souvent via des services payants.
Le modèle sait reconnaître ces barrières et proposer des suites d’actions, mais il ne peut pas les franchir. Ce test n’a pas produit de résultats très utiles, sans que le modèle en soit responsable.
Tout cela illustre pourquoi OpenAI se concentre sur les usages en entreprise, là où se trouve l’opportunité. Mais c’est aussi un rappel : beaucoup de données restent hors ligne, fragmentées, payantes ou… derrière de vraies portes.
Vision + intelligence générale
Pour le dernier test, j’ai importé un Sudoku afin d’évaluer à la fois la vision et l’intelligence générale.
Le Sudoku n’est pas des maths lourdes, car le problème est contraint. Mais présenté en image et non en texte structuré, le modèle doit combiner plusieurs compétences : lire la grille, préserver les « données initiales », puis appliquer la logique pour résoudre.
can you fill out this sudoku for me
L’image n’était pas parfaitement tracée, mais c’était voulu pour le test :
GPT-5.2 m’a rendu une grille correcte, mais a remplacé au moins un des chiffres figés qui ne devait pas bouger. On pourrait dire qu’il a « triché » sans le vouloir.
Ce type d’erreur n’est pas un défaut de raisonnement, mais une défaillance de vision et de fidélité. Le modèle a soit mal lu une case donnée, soit mal compris quelles positions étaient figées, soit perdu une contrainte lors de la conversion de l’image en grille interne.
Coûts et accès API de GPT-5.2
Les tests ci-dessus montrent ce que vous pouvez faire dans ChatGPT, mais la vraie flexibilité vient avec l’API, où vous contrôlez l’effort de raisonnement, les budgets de tokens et vos intégrations d’outils.
Les trois modèles sont disponibles dès maintenant au travers des API Responses et Chat Completions d’OpenAI :
|
Modèle |
API model string |
|
GPT-5.2 Instant |
gpt-5.2-chat-latest |
|
GPT-5.2 Thinking |
gpt-5.2 |
|
GPT-5.2 Pro |
gpt-5.2-pro |
Voici les tarifs :
- Pour GPT-5.2 Thinking : 1,75 $ par million de tokens en entrée et 14 $ par million de tokens en sortie pour le modèle Thinking de base, avec une remise de 90 % sur les entrées mises en cache.
- GPT-5.2 Pro : le modèle haut de gamme est bien plus cher : 21 $ en entrée, 168 $ en sortie.
Deux ajouts pour les utilisateurs avancés : un paramètre d’effort de raisonnement 1xhigh1 et un endpoint /compact qui étend la fenêtre de contexte effective pour les workflows longs.
GPT-5.2 face aux concurrents
Voyons comment GPT-5.2 se positionne face aux autres sorties récentes :
GPT-5.2 vs Gemini 3
Gemini 3, sorti à la mi-novembre, a écrasé les scores sur de nombreux benchmarks très suivis. Il tient la première place sur Humanity’s Last Exam et dépasse aussi GPT-5.2 Pro sur GPQA Diamond, mais de peu (93,8 % contre 93,2 %).
La forte progression de Gemini reflète probablement des améliorations à la fois dans l’implémentation de la mixture-of-experts et dans l’infrastructure d’entraînement. Gemini 3 utilise un routage parcimonieux au niveau des tokens et a été entraîné sur l’infrastructure TPU sur mesure de Google. Là où GPT-5.2 s’illustre aujourd’hui, c’est sur les benchmarks de travail professionnel comme GDPval et les évaluations d’appels d’outils orientées entreprise. C’est clairement là qu’OpenAI a concentré ses efforts.
GPT-5.2 vs Claude Opus 4.5
Claude Opus 4.5, sorti fin novembre, a suivi une autre voie. Anthropic a mis l’accent sur ce qu’ils appellent le « hybrid reasoning » — combiner réflexion étendue et intelligence de base renforcée — et le résultat est un modèle qui excelle en ingénierie logicielle et sur des tâches ouvertes. Sur SWE-bench Verified, Opus 4.5 atteint 80,9 %, juste au-dessus des 80 % de GPT-5.2.
Là où ils divergent, c’est dans le style : Opus 4.5 tend vers des réponses plus longues et délibératives, tandis que GPT-5.2 Thinking met l’accent sur l’usage d’outils et des sorties structurées comme des feuilles de calcul et des présentations. Pour des agents de code et des refactorings complexes, ils sont au coude-à-coude ; pour des workflows d’entreprise impliquant slides et rapports, OpenAI parie que GPT-5.2 a l’avantage.
Conclusion
Les regards sont braqués sur les résultats de benchmarks, et la pression doit être forte chez OpenAI. Il y a un mois, la sortie de GPT 5.1 a été éclipsée par Gemini 3. Aujourd’hui, avec GPT 5.2, OpenAI arrive de très peu derrière Gemini 3 sur GPQA et de très peu derrière Claude Opus 4.5 sur SWE-Bench Verified — de quoi frustrer l’équipe.
OpenAI met plutôt en avant ses bons résultats sur GDPval et SWE-Bench Pro, mais le premier, surtout, reste confidentiel face aux standards qui font les gros titres. On pourrait y voir la volonté de raconter une histoire gagnante sans attirer l’attention sur les classements où la société est encore devancée.
Mais la course est extrêmement serrée, et ces entreprises ont encore du terrain pour faire leurs preuves. Nous suivrons de près, entre autres, les performances des nouveaux modèles sur le prochain benchmark ARC-AGI-3, en cours de développement.
FAQ sur GPT 5.2
Qu’est-ce qui a motivé le déploiement inhabituellement rapide de GPT 5.2 ?
La sortie accélérée de GPT 5.2 a été dictée par la pression concurrentielle de Gemini 3 de Google et d’autres modèles émergents. OpenAI a voulu combler rapidement les écarts de performance, notamment en raisonnement, mémoire et utilisation d’outils, afin de préserver sa position dans un paysage de l’IA de plus en plus disputé.
GPT 5.2 va-t-il remplacer complètement GPT 5.1 et les modèles antérieurs ?
Non, GPT 5.1 restera disponible aux côtés de GPT 5.2 pour l’instant. Cela permet une transition en douceur, en conservant l’accès aux modèles existants tout en s’appropriant les améliorations de GPT 5.2.
En quoi les améliorations de GPT 5.2 profitent-elles aux utilisateurs non professionnels (hors entreprise) ?
Pour les utilisateurs au quotidien, GPT 5.2 améliore la vitesse et la précision des réponses, en particulier lors de longues conversations avec rétention du contexte. L’objectif est d’offrir une expérience plus fluide et fiable, même en dehors des workflows d’entreprise.
Y a-t-il de nouvelles fonctionnalités de sécurité ou de contrôle du contenu liées à la sortie de GPT 5.2 ?
En parallèle des gains de performance, GPT 5.2 introduit des mises à jour continues des dispositifs de sûreté, comme un filtrage de contenu renforcé et des contrôles utilisateur plus fins. OpenAI prépare également des évolutions, dont un « mode adulte » prévu pour des interactions plus encadrées.

Je suis rédacteur et éditeur dans le domaine de la science des données. Je suis particulièrement intéressé par l'algèbre linéaire, les statistiques, R, etc. Je joue également beaucoup aux échecs !