Il fait tourner un monstre IA de 744 milliards de paramètres sur son PC (et c'est open source)

Il fait tourner un monstre IA de 744 milliards de paramètres sur son PC (et c’est open source)

GLM 5.2 : le LLM open source qui tourne sur un PC de bureau (test et installation)

Et si vous pouviez faire tourner, sur votre propre ordinateur portable, un modèle d’intelligence artificielle aussi capable que GPT-5.5 ou Claude Opus 4.8, sans payer le moindre abonnement ? C’est exactement le pari relevé par un développeur italien du pseudonyme JustVugg, dont le projet a explosé sur internet. Son secret : un modèle chinois open source baptisé GLM-5.2, et une astuce technique aussi simple qu’ingénieuse.

GLM-5.2, un poids lourd totalement gratuit

Publié par le laboratoire chinois Z.ai à la mi-juin 2026, GLM-5.2 est un modèle massif : 744 milliards de paramètres au total, diffusé sous licence libre MIT, ce qui signifie que n’importe qui peut le télécharger, le modifier et l’utiliser sans restriction. Sur les grilles d’évaluation communautaires, ses performances sont jugées comparables à celles de modèles fermés et payants comme Claude Opus (version début 2024) ou GPT-5.5, notamment sur les tâches de programmation. Seul hic, et il est de taille : dans sa version complète, le modèle pèse environ 1,5 téraoctet de données. Autant dire qu’aucun ordinateur personnel ne peut, en théorie, l’accueillir en mémoire.

Petite précision technique qui change tout : GLM-5.2 utilise une architecture dite « Mixture of Experts » (mélange d’experts). Concrètement, sur les 744 milliards de paramètres, seuls 40 milliards environ sont réellement activés à chaque calcul. C’est un peu comme si, dans une immense équipe d’experts, seule une petite poignée était appelée à la rescousse pour chaque question posée, plutôt que de mobiliser tout le monde à chaque fois.

💡 Pour les non-initiés

Un modèle « open source » ou à « poids ouverts » signifie que ses créateurs publient librement les fichiers contenant les connaissances apprises par l’IA (les « poids »). N’importe qui peut alors télécharger ces fichiers et faire tourner le modèle sur ses propres machines, sans dépendre d’un service en ligne payant.

Le tour de force de Colibrì : streamer le modèle depuis le disque dur

La méthode la plus courante pour faire tourner un modèle aussi massif consiste à le « compresser » (on parle de quantification) pour qu’il tienne dans la mémoire vive. Problème : même compressé, GLM-5.2 nécessite encore environ 240 gigaoctets de mémoire, soit largement plus que n’importe quel PC ou Mac grand public, on parle de configurations à plusieurs milliers d’euros réservées aux passionnés fortunés ou aux professionnels.

C’est là que le projet Colibrì, développé par JustVugg et disponible gratuitement sur GitHub, change complètement la donne. Plutôt que de charger l’intégralité du modèle en mémoire vive, Colibrì ne garde en RAM que la partie « commune » du modèle (environ 9,9 Go), et va chercher les 370 Go restants (les fameux « experts ») directement sur le disque dur, à la demande, au fur et à mesure du raisonnement. Résultat : le modèle devient utilisable sur une machine grand public équipée d’à peine 25 à 32 Go de RAM, une configuration que possèdent déjà de nombreux PC portables un peu musclés.

ApprocheMémoire vive nécessaireVitesse
Méthode classique (quantifiée)~240 Go de RAM/VRAM3 à 9 tokens/seconde
Colibrì (streaming disque)~25 à 32 Go de RAM0,05 à 1+ token/seconde selon le disque

Le vrai prix à payer : la vitesse

Soyons honnêtes, il y a une contrepartie, et elle est de taille : la vitesse. Avec Colibrì, on parle de 0,05 à 1 token généré par seconde selon la rapidité de votre disque SSD, ce qui, pour une réponse un peu longue, peut littéralement prendre plusieurs minutes. Interrogé, l’auteur du projet a d’ailleurs été limpide sur ses intentions : « Je voulais juste que ça fonctionne, coûte que coûte, même lentement. Ce qui comptait, c’était le chemin pour y arriver. » Une philosophie assumée de bricoleur plutôt que de performance pure.

Le projet, écrit intégralement en langage C sans aucune dépendance externe, ne prétend d’ailleurs pas remplacer un usage professionnel exigeant en rapidité. Il s’adresse davantage à la communauté des curieux et des bricoleurs qui souhaitent, pour des raisons de confidentialité ou simplement de plaisir technique, posséder chez eux un modèle de cette envergure même s’il faut parfois attendre le temps de préparer un café pour obtenir une réponse.

Comment l’essayer chez vous

  • Rendez-vous sur le dépôt GitHub du projet (JustVugg/colibri) pour récupérer le code source et les instructions d’installation.
  • Comptez au minimum 25 à 32 Go de RAM et, surtout, un disque SSD NVMe rapide : c’est lui qui devient le vrai goulot d’étranglement du système.
  • Prévoyez également suffisamment d’espace disque libre : les experts du modèle représentent à eux seuls environ 370 Go de données à stocker.
  • Armez-vous de patience : ce projet est fait pour l’expérimentation et l’apprentissage, pas pour un usage de production nécessitant des réponses instantanées.

Ce type de projet illustre parfaitement l’esprit « bon plan open source » qui nous anime dans cette rubrique : la débrouille et l’ingéniosité communautaire face à des géants qui misent sur des infrastructures à plusieurs millions de dollars. Ce n’est clairement pas encore un outil pour un usage quotidien exigeant, mais c’est une preuve de concept fascinante : la frontière entre « ce qui nécessite un data center » et « ce qui tient sur mon bureau » est en train de bouger, doucement mais sûrement.

🗣️ Et vous, qu’en pensez-vous ? Seriez-vous prêt à attendre plusieurs minutes pour une réponse d’IA, en échange d’une confidentialité totale et d’un outil gratuit à vie ? Avez-vous déjà testé un modèle d’IA en local sur votre ordinateur ? Donnez-nous votre avis en commentaire !

À propos Kamleu Noumi Emeric

Je suis un ingénieur en télécommunications et je suis le créateur du site tech-connect.info. J'ai une grande passion pour l'art, les hautes technologies, les jeux, les vidéos et le design. Aimant partager mes connaissances, Je suis également blogueur pendant mon temps libre. Vous pouvez me suivre sur ma page sociale Facebook.

Consultez également

La Chine attrape sa première fusée réutilisable avec un filet géant en pleine mer, une méthode jamais tentée dans le monde

La Chine attrape sa première fusée réutilisable avec un filet géant en pleine mer, une méthode jamais tentée dans le monde

Un filet géant en pleine mer de Chine méridionale, et une fusée qui s’y suspend …

guest
0 Commentaires
Les plus récents
Les plus anciens Les plus votés
0
J'adorerais savoir ce que vous en pensez, S'il vous plaît laisser un commentaire.x