Bonjour à tous

Tu utilises ChatGPT ou Claude tous les jours. Mais sais-tu quel modèle tu utilises, et pourquoi ça change quelque chose ? Presque personne ne le sait, et ça mène à deux erreurs opposées.

La première : prendre le modèle le plus puissant pour tout, y compris pour rédiger un e-mail de trois lignes. C'est envoyer un chirurgien poser un pansement — lent, cher, et le résultat n'est pas meilleur. La seconde, à l'inverse : rester toujours sur le réglage par défaut, et passer à côté d'un vrai gain de qualité le jour où la tâche est difficile.

Dans cette édition, pas de test d'un outil, mais un guide : comprendre la « gamme » de modèles de Claude et de ChatGPT, savoir lequel prendre pour quelle tâche, et ce que ça coûte.

Si tu veux être sûr de ne pas rater les prochaines éditions, n'hésite pas à t'abonner.


Ce que tu vas trouver dans cette édition


Le principe : chaque IA est une gamme, pas un modèle

La confusion vient de là : on parle de « ChatGPT » ou « Claude » comme d'une seule chose. En réalité, chacun est une gamme de plusieurs modèles, comme une gamme de voitures : la citadine, la berline, le haut de gamme. Un petit modèle rapide et pas cher, un moyen équilibré, un grand pour les tâches difficiles, et parfois un très grand tout en haut.

Et depuis cette année, un deuxième réglage s'ajoute : l'effort de raisonnement — combien de temps le modèle réfléchit avant de répondre. Si bien que la vraie question n'est plus « quel modèle ? », mais « quel étage de la gamme, et à quel effort ? ».

Au passage, ces modèles sont devenus un sujet d'État. Les plus puissants savent désormais faire des choses sensibles — analyser des failles de sécurité informatique, raisonner sur des sujets scientifiques pointus — et le gouvernement américain les traite maintenant comme une technologie stratégique, qu'on surveille comme certains équipements militaires : on vérifie avant de laisser sortir. Résultat, cet été, les deux labos ont chacun eu leur épisode. Chez Anthropic, le modèle le plus puissant, Fable 5, a été coupé pendant 18 jours par une directive américaine sur les exportations, puis rétabli le 1er juillet. Chez OpenAI, la nouvelle génération GPT-5.6 a passé ses deux premières semaines réservée à une vingtaine de partenaires, le temps d'un examen gouvernemental, avant d'ouvrir au public le 9 juillet. Quand un produit grand public doit attendre le feu vert de Washington, c'est que ce n'est plus un simple logiciel.


La gamme Claude

Quatre étages, du moins cher au plus capable :

Modèle C'est quoi Pour quoi faire
Haiku le petit : très rapide, très bon marché trier, classer, répondre simplement en masse
Sonnet l'équilibre — le modèle par défaut rédiger, analyser, le quotidien (suffit à la plupart des gens)
Opus le costaud les problèmes vraiment durs, où une erreur coûte cher
Fable le sommet, une catégorie à part les cas critiques où seul le meilleur résultat compte

Le piège à connaître : il n'existe pas de « Claude 5 ». Fable n'est pas la version suivante de Sonnet ou d'Opus, c'est un étage au-dessus. Anthropic a changé sa façon de nommer, et c'est la confusion la plus fréquente.

Le sélecteur de modèles dans Claude

Les quatre étages dans Claude : Haiku, Sonnet, Opus — et Fable au sommet

Autre bouton à connaître, juste sous le choix du modèle : le curseur d'effort — cinq niveaux, de « Low » à « Max », réglé sur « High » par défaut. Il règle le temps de réflexion. Et il réserve une surprise : Sonnet poussé à l'effort maximal rejoint Opus sur certaines tâches — mais peut alors coûter plus cher que lui. L'effort n'est pas un gadget, c'est un vrai levier.

Le curseur d'effort dans Claude

Cinq niveaux d'effort pour le même modèle — plus tu montes, plus la réponse est travaillée, lente, et consommatrice


La gamme ChatGPT

OpenAI a pris le chemin inverse : plutôt que de te laisser choisir, il choisit pour toi. Le sélecteur propose trois modes :

Mode C'est quoi Qui y a accès
Instant le défaut, rapide, pour tout le quotidien tout le monde, même en gratuit
Thinking il réfléchit avant de répondre les abonnés payants
Pro réflexion maximale, pour les cas critiques l'abonnement le plus cher

Nouveauté du 9 juillet : OpenAI a lancé sa génération suivante, GPT-5.6, elle aussi vendue en gamme de trois — Sol (le sommet), Terra (l'équilibre), Luna (le rapide et économique). Dans l'application ChatGPT, seul Sol est branché pour l'instant, derrière le mode Thinking des abonnés payants. Terra et Luna, eux, ne sont accessibles que via l'API — explication en une phrase : l'API, c'est la prise sur laquelle les entreprises branchent le modèle directement dans leurs propres logiciels, sans passer par l'application. Toi, tu utilises l'appli ; les développeurs, la prise.

Retiens surtout la logique du nouveau nommage, parce qu'elle confirme tout ce qu'on vient de dire : le numéro indique la génération, le nom indique l'étage. Les deux labos vendent désormais des gammes.

Dernière différence de philosophie, et c'est le point à retenir : même en mode Instant, ChatGPT peut basculer tout seul vers Thinking s'il juge ta question complexe. Tu ne choisis pas, un système décide à ta place. Certains utilisateurs s'en agacent — l'impression que ChatGPT « décide que ta question ne mérite pas d'effort ». Là où Claude te donne les boutons, ChatGPT te propose un pilote automatique.


Le raisonnement, simplement

Un modèle « qui raisonne » ne répond pas du tac au tac. Il réfléchit d'abord : il se parle à lui-même, découpe le problème, vérifie, puis répond. Comme la différence entre répondre à une question à l'oral et rendre un devoir qu'on a préparé.

Ça a un coût : du temps (quelques secondes à plusieurs minutes) et de l'argent (cette réflexion se paie, on voit pourquoi juste après).

La règle simple : si tu peux vérifier la réponse d'un coup d'œil, pas besoin de raisonnement. Une reformulation, un résumé, un e-mail — inutile. Un calcul de rentabilité, une analyse en plusieurs étapes, une décision où une erreur passerait inaperçue — là, tu l'actives.


Pourquoi ta réponse coûte plus cher que ta question

Les modèles ne facturent ni au mot, ni au message, mais au token. Un token, c'est un morceau de mot — compte environ trois quarts d'un mot. C'est l'unité de mesure de toute la suite.

Deux choses à comprendre, et les prix deviennent lisibles :

1. La sortie coûte plus cher que l'entrée. Ta question, le modèle se contente de la lire — rapide, pas cher. Sa réponse, il doit la fabriquer mot après mot, chaque mot dépendant du précédent — lent, gourmand. Générer coûte plus cher que lire : c'est pour ça que la sortie est facturée environ cinq fois le prix de l'entrée.

2. Entre le petit et le grand modèle, le rapport est d'environ 1 à 10. Le tableau parle de lui-même (prix pour un million de tokens, soit environ 750 000 mots) :

Gamme Modèle Entrée Sortie
Claude Haiku 1 $ 5 $
Claude Sonnet 5 2 $ (3 $ dès sept.) 10 $ (15 $ dès sept.)
Claude Opus 5 $ 25 $
Claude Fable 10 $ 50 $
ChatGPT Luna 1 $ 6 $
ChatGPT Terra 2,50 $ 15 $
ChatGPT Sol 5 $ 30 $

Lis la colonne « sortie » de haut en bas : produire le même million de mots coûte 5 $ avec Haiku, 50 $ avec Fable. Dix fois plus. C'est tout l'argument de cette édition en un chiffre : prendre le plus gros modèle pour une tâche simple, c'est payer dix fois le prix sans meilleur résultat.

(Ces prix sont ceux de l'API — la prise pour les entreprises. Toi, tu paies un abonnement fixe, on y vient en fin d'édition. Mais ce sont ces écarts qui expliquent pourquoi ton abonnement te limite plus vite sur les gros modèles.)


Les modèles chinois moins chers : vrai ou faux bon plan ?

C'est vrai, et ça mérite d'être dit : les modèles chinois, DeepSeek en tête, affichent des prix spectaculairement bas — autour de 0,28 $ le million de tokens en entrée, quand Haiku est à 1 $ et Opus à 5 $. Sur l'étiquette, imbattable.

Mais le prix au token ne fait pas le prix de la tâche. Ce qui compte vraiment, c'est le prix au token multiplié par le nombre de tokens qu'il faut pour finir le travail. Un modèle moins efficace peut répondre plus longuement, tourner en rond, se tromper et devoir recommencer. Un modèle deux fois moins cher qui met trois fois plus de mots à répondre, c'est une promo qui te coûte plus cher à la caisse.

La bonne mesure, ce n'est pas le prix affiché, c'est le coût pour obtenir un résultat correct. Et bonne nouvelle : cette mesure existe. Artificial Analysis — un organisme indépendant qu'on retrouve juste après — calcule le coût moyen pour accomplir chaque tâche de son examen, modèle par modèle :

Coût par tâche, modèle par modèle

Le coût pour accomplir la même tâche, modèle par modèle. Source : Artificial Analysis, relevé le 16 juillet.

Trois choses à lire dans ce graphique. Un : DeepSeek tient sa promesse — 2 à 4 centimes par tâche, le moins cher du marché, pour de vrai. Deux : à l'autre bout, Fable coûte 2,75 $ pour la même tâche — l'écart de 1 à 10 qu'on vient de voir se retrouve dans la vraie vie, et au-delà. Trois, la nuance qui vaut le détour : Kimi, le modèle chinois le plus fort du moment (sur le podium du classement de la section suivante, juste devant Opus), coûte 0,94 $ la tâche — plus cher que plusieurs modèles occidentaux intermédiaires. Chinois ne veut pas automatiquement dire bon marché.

Le message n'est donc pas « méfie-toi des chinois », c'est « regarde le coût par tâche, pas le prix au token ». Un dernier point à peser pour un usage professionnel : selon le fournisseur, tes données ne transitent pas par les mêmes serveurs ni sous les mêmes règles.


Les scores que tu vois partout — et pourquoi ne pas les lire comme un classement

Tu as sûrement croisé ces graphiques qui comparent les modèles avec des scores. Ce sont des notes à des examens standardisés qu'on fait passer aux modèles. Le plus sérieux du genre est l'indice d'Artificial Analysis, qui fait passer les mêmes épreuves à tous les modèles, dans les mêmes conditions. Parmi ces épreuves :

Épreuve Ce qu'elle mesure
GPQA Diamond des questions de sciences de niveau doctorat
Terminal-Bench accomplir des tâches en autonomie sur un ordinateur
SciCode écrire du code pour des problèmes scientifiques
Humanity's Last Exam des questions parmi les plus difficiles jamais posées à une IA
GDPval des tâches de vrai travail professionnel (rapports, analyses…)

L'indice combine neuf épreuves de ce genre en un score unique. Voici le classement du moment :

Artificial Analysis Intelligence Index

Source : Artificial Analysis, relevé le 16 juillet. Les modèles de raisonnement sont testés à leur réglage maximal.

Maintenant, regarde les chiffres de près, parce qu'ils racontent autre chose que « qui est le plus fort ». En tête : Fable 5 à 60, GPT-5.6 Sol à 59, Opus à 56, Sonnet à 53. L'écart entre le sommet et le milieu de gamme tient en quelques points — sur des examens de niveau doctorat que tu ne passeras jamais. Autre détail parlant : Luna, le petit dernier d'OpenAI, fait quasiment jeu égal avec le gros modèle de la génération précédente. Les générations montent, les étages restent.

Et regarde Haiku, vers la droite du graphique : 30, la moitié du score de Fable. C'est pourtant un excellent modèle pour trier, classer et répondre vite. La leçon est là : ces examens mesurent la capacité à résoudre des problèmes extrêmes, pas la qualité de ton e-mail de demain matin.

Trois réflexes pour lire ces classements : les écarts en tête se comptent en points ; les épreuves ne ressemblent pas à ton travail ; et le classement change tous les mois — celui-ci date du 16 juillet, il aura peut-être bougé en août.

La vérité que ces graphiques cachent : pour 90 % de ton travail, tous les modèles du haut du tableau sont excellents. Les vraies différences pour toi, ce sont la vitesse et le prix.


Le guide à garder

Ta tâche Chez Claude Chez ChatGPT
E-mail, reformulation, résumé court Sonnet (effort bas) Instant
Rédaction soignée, analyse de document, quotidien Sonnet (le défaut a raison) Instant
Problème dur, code complexe, décision qui coûte cher Opus, ou Sonnet à effort maximal Thinking
Le cas critique où une erreur coûterait très cher Fable Pro

Et la règle de bon sens qui résume tout : commence toujours par le modèle par défaut ; monte d'un étage seulement si le résultat te déçoit. La plupart des gens n'ont jamais besoin de monter.


Et toi, tu paies quoi ?

Tout ce qui précède parle de prix au token — ça, c'est l'API, la prise pour les entreprises. Pour un usage normal via l'application, tu paies un abonnement fixe, et tu n'as pas à compter les tokens.

En gratuit, tu as le modèle du quotidien des deux côtés (Sonnet chez Claude, Instant chez ChatGPT), avec une limite d'usage. À 20 $/mois (Claude Pro, ChatGPT Plus), tu débloques plus de volume et le raisonnement — largement suffisant pour l'immense majorité des usages. Les offres à 100-200 $/mois ne se justifient que si tu tapes dans les limites chaque semaine, ou s'il te faut le tout dernier étage de la gamme.


Mot de fin

La bonne nouvelle, c'est que choisir un modèle est plus simple qu'il n'y paraît : commence par le défaut, monte seulement si tu es déçu, et garde le raisonnement pour ce que tu ne peux pas vérifier d'un coup d'œil. Le reste — les scores, les numéros de version, les gammes qui changent tous les mois — c'est du bruit dont tu peux te passer.

Une chose est sûre : ces gammes auront encore bougé dans trois mois. C'est pour ça que ce guide tient sur des principes, pas sur des noms de modèles.

Si un outil te fait de l'œil et que tu veux qu'on le teste, n'hésite pas à nous le faire savoir.

Lucius

Une question, une réaction ? Écris-nous à contact@readlucius.com.