Alibaba n’a pas fait dans la demi-mesure. Le 18 septembre 2026, l’équipe Qwen a lancé Qwen3.8-Omni-Flash, un modèle d’intelligence artificielle capable d’ingurgiter du texte, des images, de l’audio et de la vidéo en une seule et même passe, avec une fenêtre de contexte d’un million de tokens, de quoi analyser plusieurs heures de vidéo ou des dizaines de documents en une seule requête. Voici ce qu’il y a vraiment sous le capot, et pourquoi ce lancement mérite votre attention même si vous n’êtes pas développeur.
Omni, ça veut dire quoi exactement ?
Le terme « Omni » n’est pas un simple argument marketing. La plupart des modèles d’IA grand public, comme ChatGPT ou Claude, traitent principalement du texte et parfois des images. Qwen3.8-Omni-Flash va plus loin : il accepte simultanément quatre types d’entrées différentes (texte, images, audio et vidéo) et produit une réponse textuelle en sortie. Concrètement, vous pourriez lui montrer une vidéo de trente minutes tout en lui parlant à voix haute, et il traiterait l’ensemble comme un seul flux d’information cohérent.
| 💡 À SAVOIR On parle de modèle multimodal quand une IA peut comprendre et croiser plusieurs types de données à la fois (texte, image, son, vidéo) plutôt que de se limiter à un seul format. C’est un peu la différence entre lire un livre et regarder un film avec le son : le second apporte des couches d’information supplémentaires (ton de la voix, mouvement, contexte visuel) qu’un texte seul ne peut pas transmettre. |
Une fenêtre de contexte gigantesque
Construit sur une nouvelle architecture baptisée Qwen3.8-Flash-Next, le modèle affiche une fenêtre de contexte d’un million de tokens dont environ 991 000 tokens réservés à l’entrée et jusqu’à 131 000 tokens pour la réponse générée. Pour donner une idée concrète, un token correspond en moyenne à un mot ou une portion de mot en français ; un million de tokens représente donc l’équivalent de plusieurs romans entiers, ou de plusieurs heures de contenu vidéo transcrit et analysé simultanément.
Autre particularité technique : le modèle dispose d’un mode de raisonnement approfondi, activé par défaut avec un niveau d’effort qualifié de « très élevé » par Alibaba, qui lui permet de mobiliser jusqu’à 262 000 tokens de réflexion interne avant de répondre, un peu comme si l’IA prenait le temps de brouillonner sa réponse avant de la formuler clairement. Ce mode peut être désactivé par les développeurs qui privilégient la rapidité à la précision maximale.
Des gains de performance qui se mesurent
Alibaba communique des chiffres précis pour étayer ses affirmations, comparant Qwen3.8-Omni-Flash à son prédécesseur direct, Qwen3.5-Omni-Plus, sur 29 évaluations différentes : une amélioration moyenne supérieure à 25 %.
| Benchmark | Amélioration / score |
| WildClawBench-MM | +36,5 points par rapport au modèle précédent |
| AgenticVBench (usage d’outils en contexte vidéo) | +22,3 points |
| OmniVideoBench | +9,6 points |
| Précision perception agentique vidéo | De 63,4 à 67,8, avec 45,7 % de tokens vidéo en moins |
Ce dernier point mérite d’être souligné : le modèle est parvenu à améliorer sa précision sur l’analyse vidéo tout en réduisant de près de moitié la quantité de données qu’il doit traiter pour y parvenir. C’est le signe d’une meilleure « compression » de l’information visuelle pertinente, plutôt qu’un simple gavage de puissance de calcul.
Un argument choc : le prix
Si les tests de performance parlent aux ingénieurs, c’est bien la tarification qui devrait retenir l’attention du plus grand nombre. Sur la plateforme QwenCloud, le modèle est facturé 0,15 dollar par million de tokens en entrée et 0,47 dollar par million de tokens en sortie, avec un tarif encore réduit à 0,016 dollar pour les tokens mis en cache (c’est-à-dire réutilisés d’une requête à l’autre sans être retraités intégralement).
| 📝 NOTE Comparé à Qwen3.5-Omni-Plus, son prédécesseur, Alibaba annonce une réduction de coût de 98 % pour le traitement audio seul, 93 % pour l’audio-vidéo combiné, et environ 89 % pour la vidéo seule. Si ces chiffres se confirment à l’usage, cela rendrait des applications jusque-là réservées aux grandes entreprises (transcription massive de réunions, analyse de contenus vidéo à grande échelle) accessibles à des budgets bien plus modestes. |
Ce que le modèle sait vraiment faire
Alibaba met en avant trois capacités phares pour illustrer le potentiel du modèle :
- La construction d’une mémoire audio-visuelle : le modèle peut retenir et recouper des informations issues de plusieurs sources audio et vidéo au fil d’une conversation prolongée.
- La conversion d’une vidéo tutoriel en PDF illustré : transformer automatiquement un contenu vidéo pédagogique en document texte structuré, avec captures d’écran pertinentes intégrées.
- L’édition vidéo assistée : génération de clips musicaux, ajout de commentaires, ou traduction d’une vidéo tout en préservant la voix et l’intonation du locuteur d’origine.
Comment y accéder et ce qui manque
| ⚠️ ATTENTION Contrairement à d’autres modèles de la famille Qwen, habituellement distribués en open source, Qwen3.8-Omni-Flash n’est disponible, à son lancement, que via une API hébergée sur QwenCloud, Alibaba Cloud Model Studio et Qwen Studio. Aucun poids de modèle n’a été publié en téléchargement libre, ce qui exclut, pour l’instant, tout auto-hébergement sur votre propre matériel, une différence de taille avec un modèle comme Bonsai-2, pensé justement pour tourner en local. |
Un kit d’intégration nommé Qwen-MM-Plugins, distribué sous licence Apache 2.0, permet en revanche aux développeurs de connecter plus facilement le modèle à des outils externes dans une logique d’agent autonome.
Face à la concurrence
Alibaba positionne directement son modèle contre Gemini 3.8 Flash de Google, affirmant une performance audio-visuelle comparable et une performance audio globale supérieure. Ces affirmations proviennent toutefois de l’équipe Qwen elle-même, et méritent d’être prises avec la prudence habituelle réservée aux communications d’entreprise sur leurs propres produits.
On en débat ?
- L’absence de version open source pour ce modèle change-t-elle votre intérêt, vous qui suivez plutôt les modèles auto-hébergeables comme GLM-5.2 ou Bonsai-2 ?
- Une IA capable d’analyser plusieurs heures de vidéo d’un coup vous semble-t-elle utile dans votre usage personnel ou professionnel ?
- La baisse spectaculaire des coûts de traitement audio-vidéo va-t-elle, selon vous, démocratiser des usages jusqu’ici réservés aux grandes entreprises ?
Tech-Connect Actualités tech, tutoriels et astuces informatiques expliqués simplement