Lexique IA token, inférence, latence, throughput expliqués

Lexique IA : token, inférence, latence, throughput, le glossaire pour ne plus jamais être perdu

Après nos articles sur la latence, le débit et les modèles Flash, il manquait une pièce essentielle : un lexique clair, que vous pourrez garder sous le coude à chaque fois qu’un article technique sur l’intelligence artificielle vous semblera écrit dans une langue étrangère.

Token : l’unité de base que manipule une IA

Un token est le plus petit morceau de texte qu’une IA générative traite à la fois. Contrairement à une idée reçue très répandue, un token ne correspond pas forcément à un mot entier : il peut s’agir d’un mot court complet, d’une partie de mot plus long, voire d’un simple signe de ponctuation.

Exemple concret : le mot « chat » constitue probablement un seul token, alors qu’un mot plus rare ou composé comme « anticonstitutionnellement » sera généralement découpé en plusieurs tokens par le modèle. En moyenne, en français, on compte grossièrement entre un et deux tokens par mot.

Pourquoi ce détail compte pour vous : la plupart des services d’IA facturent leur usage au nombre de tokens traités, à la fois pour votre question (les tokens d’entrée) et pour la réponse générée (les tokens de sortie). C’est aussi ce qui explique pourquoi une IA peut parfois « s’arrêter en plein milieu » d’une réponse longue : elle a atteint sa limite de tokens autorisée pour cet échange.

🔵 Le saviez-vous ? Les modèles d’IA ont une limite de « fenêtre de contexte », c’est-à-dire un nombre maximal de tokens qu’ils peuvent traiter en une seule fois, question et réponse comprises. Plus cette fenêtre est grande, plus l’IA peut « se souvenir » d’informations données plus tôt dans une longue conversation ou analyser un document volumineux d’un seul coup.

Inférence : le moment où l’IA « réfléchit » à sa réponse

L’inférence désigne le processus par lequel un modèle d’IA déjà entraîné utilise ce qu’il a appris pour produire une réponse à une nouvelle question. C’est à ne pas confondre avec l’entraînement (ou training), cette phase antérieure et beaucoup plus longue durant laquelle le modèle a « appris » en analysant d’immenses quantités de données textuelles.

Exemple concret : quand vous posez une question à un chatbot, vous ne déclenchez jamais un nouvel entraînement du modèle. Vous déclenchez une inférence : le modèle applique ce qu’il a déjà appris, sans rien modifier de sa mémoire de fond, pour calculer la réponse la plus probable à votre question précise.

C’est justement le coût de cette étape d’inférence, répétée des milliards de fois chaque jour à travers le monde, qui explique pourquoi les entreprises d’IA investissent autant dans du matériel spécialisé capable de la rendre plus rapide et moins coûteuse.

Latence : le temps d’attente avant la réponse

On l’a détaillé en profondeur dans un précédent article de cette rubrique, mais pour rappel : la latence désigne le délai entre le moment où vous envoyez votre question et celui où l’IA commence à produire sa réponse. C’est le silence, parfois pesant, qui précède le premier mot affiché ou prononcé.

Exemple concret : si vous posez une question complexe à un assistant IA et que trois secondes s’écoulent avant que le premier mot n’apparaisse à l’écran, cette durée de trois secondes est la latence de la requête.

Débit (throughput) : la vitesse une fois la réponse lancée

Le débit, ou throughput en anglais, mesure la quantité de texte générée par seconde une fois que l’IA a commencé à répondre. On l’exprime généralement en tokens par seconde. Plus ce chiffre est élevé, plus le texte défile rapidement à l’écran, ou plus une voix synthétique parle de façon fluide sans micro-coupures perceptibles.

Exemple concret : un service capable de générer 750 tokens par seconde produira une réponse de plusieurs paragraphes en quelques fractions de seconde à peine, quasiment plus vite que vous ne pouvez la lire à l’écran.

🟡 Le combo à retenir

Une bonne expérience d’IA, en particulier à l’oral, dépend d’une latence courte ET d’un débit élevé. L’un sans l’autre laisse toujours un sentiment d’inconfort à l’utilisateur, même s’il ne saurait pas mettre de mot dessus.

Le lexique en un coup d’œil

TermeDéfinition expressÀ retenir
TokenPlus petite unité de texte traitée par l’IA≈ 1 à 2 tokens par mot en français
InférenceUtilisation d’un modèle déjà entraîné pour répondreDifférent de l’entraînement du modèle
LatenceDélai avant le premier mot de la réponseCritique pour les usages vocaux
Débit (throughput)Vitesse de génération une fois lancéeMesuré en tokens par seconde

Ces quatre mots, une fois démystifiés, changent complètement la lecture qu’on peut faire de l’actualité technologique. Un article qui annonce fièrement « notre IA génère 750 tokens par seconde » devient soudain beaucoup plus parlant une fois qu’on sait ce que ce chiffre signifie concrètement pour l’expérience utilisateur.

À propos Kamleu Noumi Emeric

Je suis un ingénieur en télécommunications et je suis le créateur du site tech-connect.info. J'ai une grande passion pour l'art, les hautes technologies, les jeux, les vidéos et le design. Aimant partager mes connaissances, Je suis également blogueur pendant mon temps libre. Vous pouvez me suivre sur ma page sociale Facebook.

Consultez également

Modèles IA Flash Mini à quoi ça sert vraiment

Pourquoi les modèles « Flash » / « Mini » existent (et quand ils suffisent largement)

Pourquoi tous les grands éditeurs d’intelligence artificielle proposent, à côté de leur modèle vedette, une …

guest
0 Commentaires
Les plus récents
Les plus anciens Les plus votés
0
J'adorerais savoir ce que vous en pensez, S'il vous plaît laisser un commentaire.x