Après nos articles sur la latence, le débit et les modèles Flash, il manquait une pièce essentielle : un lexique clair, que vous pourrez garder sous le coude à chaque fois qu’un article technique sur l’intelligence artificielle vous semblera écrit dans une langue étrangère.
Token : l’unité de base que manipule une IA
Un token est le plus petit morceau de texte qu’une IA générative traite à la fois. Contrairement à une idée reçue très répandue, un token ne correspond pas forcément à un mot entier : il peut s’agir d’un mot court complet, d’une partie de mot plus long, voire d’un simple signe de ponctuation.
Exemple concret : le mot « chat » constitue probablement un seul token, alors qu’un mot plus rare ou composé comme « anticonstitutionnellement » sera généralement découpé en plusieurs tokens par le modèle. En moyenne, en français, on compte grossièrement entre un et deux tokens par mot.
Pourquoi ce détail compte pour vous : la plupart des services d’IA facturent leur usage au nombre de tokens traités, à la fois pour votre question (les tokens d’entrée) et pour la réponse générée (les tokens de sortie). C’est aussi ce qui explique pourquoi une IA peut parfois « s’arrêter en plein milieu » d’une réponse longue : elle a atteint sa limite de tokens autorisée pour cet échange.
| 🔵 Le saviez-vous ? Les modèles d’IA ont une limite de « fenêtre de contexte », c’est-à-dire un nombre maximal de tokens qu’ils peuvent traiter en une seule fois, question et réponse comprises. Plus cette fenêtre est grande, plus l’IA peut « se souvenir » d’informations données plus tôt dans une longue conversation ou analyser un document volumineux d’un seul coup. |
Inférence : le moment où l’IA « réfléchit » à sa réponse
L’inférence désigne le processus par lequel un modèle d’IA déjà entraîné utilise ce qu’il a appris pour produire une réponse à une nouvelle question. C’est à ne pas confondre avec l’entraînement (ou training), cette phase antérieure et beaucoup plus longue durant laquelle le modèle a « appris » en analysant d’immenses quantités de données textuelles.
Exemple concret : quand vous posez une question à un chatbot, vous ne déclenchez jamais un nouvel entraînement du modèle. Vous déclenchez une inférence : le modèle applique ce qu’il a déjà appris, sans rien modifier de sa mémoire de fond, pour calculer la réponse la plus probable à votre question précise.
C’est justement le coût de cette étape d’inférence, répétée des milliards de fois chaque jour à travers le monde, qui explique pourquoi les entreprises d’IA investissent autant dans du matériel spécialisé capable de la rendre plus rapide et moins coûteuse.
Latence : le temps d’attente avant la réponse
On l’a détaillé en profondeur dans un précédent article de cette rubrique, mais pour rappel : la latence désigne le délai entre le moment où vous envoyez votre question et celui où l’IA commence à produire sa réponse. C’est le silence, parfois pesant, qui précède le premier mot affiché ou prononcé.
Exemple concret : si vous posez une question complexe à un assistant IA et que trois secondes s’écoulent avant que le premier mot n’apparaisse à l’écran, cette durée de trois secondes est la latence de la requête.
Débit (throughput) : la vitesse une fois la réponse lancée
Le débit, ou throughput en anglais, mesure la quantité de texte générée par seconde une fois que l’IA a commencé à répondre. On l’exprime généralement en tokens par seconde. Plus ce chiffre est élevé, plus le texte défile rapidement à l’écran, ou plus une voix synthétique parle de façon fluide sans micro-coupures perceptibles.
Exemple concret : un service capable de générer 750 tokens par seconde produira une réponse de plusieurs paragraphes en quelques fractions de seconde à peine, quasiment plus vite que vous ne pouvez la lire à l’écran.
| 🟡 Le combo à retenir Une bonne expérience d’IA, en particulier à l’oral, dépend d’une latence courte ET d’un débit élevé. L’un sans l’autre laisse toujours un sentiment d’inconfort à l’utilisateur, même s’il ne saurait pas mettre de mot dessus. |
Le lexique en un coup d’œil
| Terme | Définition express | À retenir |
| Token | Plus petite unité de texte traitée par l’IA | ≈ 1 à 2 tokens par mot en français |
| Inférence | Utilisation d’un modèle déjà entraîné pour répondre | Différent de l’entraînement du modèle |
| Latence | Délai avant le premier mot de la réponse | Critique pour les usages vocaux |
| Débit (throughput) | Vitesse de génération une fois lancée | Mesuré en tokens par seconde |
Ces quatre mots, une fois démystifiés, changent complètement la lecture qu’on peut faire de l’actualité technologique. Un article qui annonce fièrement « notre IA génère 750 tokens par seconde » devient soudain beaucoup plus parlant une fois qu’on sait ce que ce chiffre signifie concrètement pour l’expérience utilisateur.
