Prix de l'IA pourquoi les modèles sont presque gratuits

Prix de l’IA : pourquoi les modèles sont presque gratuits

Il y a cinq ans, faire lire un texte à une intelligence artificielle coûtait de quoi vous faire grimacer. Aujourd’hui, en ce début octobre 2026, deux des modèles les plus récents du marché, GPT-6 Luna d’OpenAI et Claude Haiku 5.5 d’Anthropic, s’affichent chacun à 0,10 dollar le million de tokens en entrée. Une obole. Presque de la monnaie de singe.

Alors, pourquoi cette dégringolade ? Qui y gagne ? Et surtout, pourquoi, malgré des prix qui s’effondrent, certaines entreprises se plaignent-elles encore de leurs factures d’IA ? On déroule le fil.

D’abord, un « token », ça se mesure comment ?

📘 Définition pour débutants : le token

Une IA ne lit pas les mots comme vous : elle les découpe en petits morceaux appelés tokens. Un token, c’est grosso modo un mot court, ou un bout de mot. En anglais, la règle empirique est qu’un million de tokens équivaut à environ 750 000 mots ; en français, un peu moins, car nos mots sont plus longs. Les fournisseurs facturent à l’usage : un tarif pour ce que vous envoyez (l’entrée), un autre, plus élevé, pour ce que l’IA écrit en retour (la sortie).

Un exemple pour fixer les idées. Un rapport de 200 pages représente, à la louche, 150 000 tokens (c’est mon estimation, elle varie selon la langue et la mise en page). Avec Luna à 0,10 $ le million, le faire lire à l’IA coûte environ 1,5 centime. Avec Sol, le grand frère à 2 $, on monte à 30 centimes. Et avec les tarifs de GPT-3 en 2021, aux alentours de 60 $ le million, la même lecture aurait coûté 9 dollars.

Le tableau des prix (début octobre 2026)

ModèleEntrée (par million)Sortie (par million)À noter
GPT-6 Luna (OpenAI)0,10 $0,50 $Lancé le 22 sept. 2026
Claude Haiku 5.5 (Anthropic)0,10 $0,50 $Pour les prompts jusqu’à 100 000 tokens
Gemini 3.5 Flash-Lite (Google)0,30 $2,50 $Source tierce
Gemini 3.8 Flash (Google)0,75 $3,75 $Tarif d’introduction
GPT-6 Sol (OpenAI)2,00 $10,00 $Modèle premium
Claude Sonnet 5.5 (Anthropic)2,00 $10,00 $Modèle intermédiaire

Prix publics pour les développeurs (API), hors réductions de lots ou de cache. Ils ne correspondent pas à ce que vous payez en utilisant l’application grand public.

Remarquez l’écart : entre Luna et Sol, il y a un facteur 20 à l’entrée. Et chez Anthropic, Haiku 4.5 coûtait 1 $ à l’entrée il y a peu ; Haiku 5.5 la divise par dix sur le papier. L’entreprise, elle, annonce une baisse d’environ 75 % en moyenne sur des tâches réelles, car son nouveau tokenizer (le « découpeur » de texte) produit un peu plus de tokens qu’avant.

Pourquoi ça dégringole : une loi de 10 par an ?

Les analystes ont une jolie formule pour ça : l’« LLMflation », une inflation à l’envers. D’après le fonds a16z (étude publiée en novembre 2024), pour une performance donnée, le coût d’un modèle de langage baisse d’un facteur 10 chaque année. Leur illustration : en 2021, GPT-3 était le seul modèle à atteindre un certain score à un test de connaissances, pour environ 60 $ le million de tokens. À la fin de 2024, un petit modèle libre, Llama 3.2 3B, faisait aussi bien pour environ 0,06 $. Soit mille fois moins en trois ans.

L’institut Epoch AI a mesuré la même chose autrement, et trouve des baisses allant de 9 à 900 fois par an selon le niveau de performance visé. Ses auteurs avertissent d’ailleurs que les chutes les plus brutales datent de l’an dernier, et qu’il n’est pas sûr qu’elles durent.

Les ingrédients, eux, sont assez consensuels : des puces plus efficaces, des logiciels qui font tourner les modèles plus économiquement, des modèles plus petits mais mieux entraînés, et une concurrence féroce, y compris des modèles ouverts, qui interdit à chacun de rester cher trop longtemps.

Le piège : des prix bas, mais des factures qui gonflent

⚠️ « Presque gratuit » ne veut pas dire « gratuit » Les modèles « qui réfléchissent » consomment bien plus de tokens. Ils rédigent en coulisses de longs brouillons avant de répondre, et ces brouillons sont facturés, les usages explosent. Quand une page de texte coûte un centime, on en fait lire mille, et les agents (des IA qui enchaînent des tâches seules) peuvent en consommer des quantités vertigineuses. Les promotions ont une date de péremption. D’après un agrégateur de tarifs, les Gemini 3.6 à 3.8 Flash sont à 0,75 $ en entrée jusqu’au 31 décembre 2026, puis doubleraient au 1er janvier 2027. À vérifier chez Google avant de bâtir un budget dessus.

Cela rappelle d’ailleurs des informations récentes selon lesquelles Meta et Microsoft freineraient l’usage interne de Claude pour des raisons de coûts. Même sans cela, le mécanisme est connu : plus c’est abordable, plus on en consomme, et la note totale ne baisse pas pour autant. Les économistes y voient un vieux paradoxe, celui de Jevons, né au XIXᵉ siècle avec le charbon.

Et pour vous, lecteur du quotidien ?

  • Les offres gratuites s’améliorent. C’est dans ce contexte qu’OpenAI sert GPT-6 Luna aux comptes gratuits (voir notre article sur GPT-6 gratuit).
  • Les petits modèles suffisent souvent. Résumer, trier des mails, reformuler : inutile de dégainer le modèle premium pour tout.
  • Si vous bricolez avec l’API, choisissez le modèle selon la tâche, pas selon la mode : un tri de 10 000 avis clients avec Luna ou Haiku coûtera quelques centimes.
  • Méfiez-vous des abonnements à vie à un outil d’IA : les prix baissent vite, votre contrat, lui, ne bouge pas.
💡 Note : Entre nous, cette course aux prix cassés n’a rien d’une œuvre de charité : attirer des millions d’utilisateurs, créer l’habitude, puis proposer l’offre payante, c’est un schéma ancien comme le commerce. À vous de décider ce que vous acceptez de payer… en données ou en abonnement.

À propos Kamleu Noumi Emeric

Je suis un ingénieur en télécommunications et je suis le créateur du site tech-connect.info. J'ai une grande passion pour l'art, les hautes technologies, les jeux, les vidéos et le design. Aimant partager mes connaissances, Je suis également blogueur pendant mon temps libre. Vous pouvez me suivre sur ma page sociale Facebook.

Consultez également

Mistral Large 4 le monstre français à 1 000 milliards

Mistral Large 4 « Le Chonk » : la France sort un mastodonte de 1 000 milliards de paramètres… et promet de le donner

Le 6 octobre 2026, Mistral AI a dévoilé Mistral Large 4, affectueusement surnommé « Le …

guest
0 Commentaires
Les plus récents
Les plus anciens Les plus votés
0
J'adorerais savoir ce que vous en pensez, S'il vous plaît laisser un commentaire.x