IA À chaud
IA À chaud

GPT-6 Astra est sorti : quelques points de mieux en code, deux fois et demie le prix

OpenAI a commencé à déployer GPT-6 Astra. Les gains sont réels — 74,1 % sur DeepSWE contre 70,8 %, 72,6 % sur OSWorld contre 65,7 %. Le tarif l'est aussi : 10 $ en entrée et 50 $ en sortie par million de tokens, soit deux fois et demie le prix promotionnel de GPT-5.6 Sol. Le bon réflexe n'est pas de basculer.

GPT-6 Astra est sorti : quelques points de mieux en code, deux fois et demie le prix

Ce qui s’est passé

Le 3 septembre, OpenAI a commencé à déployer GPT-6 Astra, d’abord aux clients entreprise du programme Daybreak, puis aux formules Plus, Pro, Business et Enterprise, avec l’accès API dans la foulée. Sam Altman a reconnu publiquement un déploiement « brouillon » : l’annonce a précédé la disponibilité réelle de plusieurs jours.

Les gains sont mesurables. Sur DeepSWE v1.1, un banc d’essai de code, Astra obtient 74,1 % contre 70,8 % pour GPT-5.6 Sol. Sur OSWorld V2-Offline, qui mesure le pilotage d’un ordinateur, il passe de 65,7 % à 72,6 %. Le modèle tient mieux le contexte sur les tâches longues et travaille sur plusieurs sous-tâches en parallèle.

Deux réserves méthodologiques, signalées par The New Stack. Le score de 98,6 % sur ARC-AGI-3 est celui du système d’agents d’OpenAI, pas du modèle seul. Et sur le code, Muse 1.3 de Meta afficherait 75,4 % — au-dessus d’Astra.

Le tarif, lui, n’a pas de réserve : 10 $ le million de tokens en entrée, 50 $ en sortie. Deux fois et demie le prix promotionnel de Sol. C’est exactement le tarif de Claude Fable 5.1. Et c’est treize fois le prix de sortie de Gemini 3.8 Flash (3,75 $) ou de Muse Spark (4,25 $).

Ce que ça veut dire

Un rapport de un à treize sur le coût de sortie, pour un écart de trois points sur un banc d’essai de code : la question n’est plus « quel est le meilleur modèle », elle est « sur quelles tâches l’écart de qualité vaut l’écart de prix ».

Pour une activité solo, la réponse est presque toujours : sur très peu de tâches. Reformuler un e-mail, résumer un appel, générer une variante de page de vente — un modèle à 4 $ le million de tokens en sortie les réussit. Tu ne paieras pas treize fois plus cher pour un résultat que tu ne sais pas distinguer.

C’est le raisonnement qu’on développe dans le modèle le plus puissant n’est pas ton choix par défaut, et la sortie d’Astra en est l’illustration la plus nette de l’année. Le vrai indicateur, c’est le coût d’une tâche donnée multiplié par sa fréquence. Un modèle cher sur une tâche rare coûte moins qu’un modèle moyen sur une tâche quotidienne.

Il y a un endroit où Astra change réellement quelque chose : les sessions longues et le pilotage d’ordinateur. Sept points sur OSWorld, ce n’est pas cosmétique — c’est la différence entre un agent qui abandonne au milieu d’un enchaînement et un agent qui le termine. Si ton usage est là, le surcoût s’argumente. Sinon, non.

Ce que tu fais lundi matin

Liste tes trois usages IA les plus fréquents — pas les plus impressionnants, les plus fréquents. Pour chacun, note combien de fois par semaine tu le déclenches.

Fais tourner le même prompt sur ton modèle actuel et sur un modèle à bas coût. Compare les deux sorties côte à côte, sans regarder l’étiquette. Si tu ne distingues pas, le choix est fait. La méthode complète tient dans router tes tâches pour réduire la facture.

Garde le modèle cher pour une seule chose, celle où tu as constaté une différence toi-même. Un seul poste haut de gamme dans un budget d’outils IA tenable, c’est raisonnable. Trois, c’est une facture qui glisse.

Le piège à éviter

Le piège du jour, c’est la bascule par défaut : le nouveau modèle sort, on met à jour la configuration, on n’y repense plus. Le surcoût ne se voit pas le premier mois — il se voit en décembre, sur un cumul.

L’autre piège est symétrique et plus coûteux : rester par principe sur le modèle bon marché quand la tâche demande vraiment mieux. Un agent qui abandonne à mi-parcours te coûte ta soirée, pas quelques centimes. Le bon arbitrage n’est ni « toujours le meilleur » ni « toujours le moins cher » : c’est de savoir, tâche par tâche, laquelle des deux règles s’applique.