Depuis plus de cinquante ans, des sondes, des orbiteurs et des instruments scientifiques observent la Lune sans relâche, empilant une quantité de données qui donne le vertige : des pétaoctets d’images, de cartes et de mesures, accumulés mission après mission. Le problème n’a jamais été le manque d’informations sur notre satellite naturel, c’est même l’inverse. Le vrai goulot d’étranglement, c’est la capacité humaine à digérer cette montagne de données pour en tirer des connaissances exploitables. C’est précisément ce verrou que la NASA et IBM viennent de tenter de faire sauter, en publiant en libre accès un modèle d’intelligence artificielle baptisé NASA-IBM Lunar Foundation Model, accompagné d’un jeu de données lunaires unifié sans précédent.
| 🔵 Pour les non-initiés : c’est quoi, un « modèle de fondation » ? Un modèle de fondation (foundation model, en anglais) est un modèle d’intelligence artificielle entraîné une seule fois, sur une quantité massive de données générales, pour ensuite servir de base à de nombreuses tâches différentes, un peu comme on apprendrait d’abord à un étudiant les bases larges d’une discipline, avant de le spécialiser ensuite sur un sujet précis. C’est le même principe que les grands modèles de langage comme GPT ou Claude, mais appliqué ici non pas au texte, mais à des images et des mesures scientifiques de la surface lunaire. L’intérêt : au lieu de construire un outil d’IA différent pour chaque question (un pour les cratères, un pour la glace, un pour les volcans), les chercheurs peuvent réutiliser et ajuster un seul modèle de base pour chacun de ces usages, ce qui économise un temps et des ressources informatiques considérables. |
Pourquoi la Lune a-t-elle besoin d’un tri automatique ?
Pour comprendre l’intérêt de ce modèle, il faut d’abord comprendre comment les scientifiques travaillaient jusqu’ici. Deux méthodes coexistaient, et aucune n’était pleinement satisfaisante : l’analyse manuelle, où des chercheurs examinent des images une à une pour repérer des cratères, des dépôts de glace ou des formations géologiques, un travail fastidieux et impossible à mener à l’échelle de pétaoctets de données ; et les modèles d’IA à basse résolution conçus pour une tâche unique, qui manquent souvent de la précision nécessaire pour des analyses géologiques fines, tout en étant coûteux à faire tourner.
Le NASA-IBM Lunar Foundation Model change la donne en offrant un socle unique, que les chercheurs peuvent ensuite adapter, on parle de « fine-tuning », c’est-à-dire un réglage fin, à leur question de recherche spécifique, sans repartir de zéro à chaque fois. C’est un changement de méthode aussi important que le changement d’outil lui-même : on passe d’une multitude de petits outils isolés à un socle commun réutilisable par toute la communauté scientifique mondiale.
Un jeu de données lunaires sans précédent
Le modèle a été entraîné à partir d’un jeu de données baptisé SomBench, dont l’ampleur mérite d’être détaillée pour bien saisir ce que représente cette publication :
| Caractéristique | Détail |
| Volume de tuiles d’entraînement | Environ 2 millions de tuiles lunaires co-alignées |
| Modalités de données | 11 types de mesures différentes, sur 2 échelles spatiales |
| Imagerie haute résolution | Plus d’1 million d’images à 1 mètre par pixel (caméra LROC NAC) |
| Imagerie multispectrale | Près de 964 000 images à 100 mètres par pixel |
| Couches de données | Plus de 30 couches spatialement alignées |
| Instruments et missions | 9 instruments répartis sur 4 missions (LRO, GRAIL, Lunar Prospector, SELENE/Kaguya de la JAXA) |
| Licence | Apache 2.0 (open source) |
| Architecture | Encodeur-décodeur de type ViT-B (Vision Transformer), entraîné depuis zéro |
Un détail impressionnant à lui seul illustre l’ampleur du travail : les données de la sonde LRO (Lunar Reconnaissance Orbiter), à elles seules, dépassent en volume celles de toutes les autres missions planétaires de la NASA réunies. C’est cette masse de données, jusqu’ici largement sous-exploitée faute d’outils adaptés, que le nouveau modèle cherche à rendre enfin exploitable à grande échelle.
| 📝 Ce modèle ne sort pas de nulle part Le NASA-IBM Lunar Foundation Model s’inscrit dans la continuité d’un partenariat déjà bien établi entre les deux organisations. En 2024, la NASA et IBM avaient publié Prithvi, une famille de modèles de fondation dédiés à l’observation de la Terre, également disponible sur Hugging Face. En 2025, le duo avait récidivé avec Surya, le premier modèle de fondation dédié à l’héliophysique, l’étude du Soleil et de son influence sur son environnement, entraîné sur des observations solaires à haute résolution. Le modèle lunaire est donc la troisième pierre de cet édifice, qui étend progressivement la même philosophie d’IA ouverte à différents corps et phénomènes du système solaire. |
Des résultats mesurables sur trois cas d’usage concrets
IBM et la NASA n’ont pas publié ce modèle sans le tester. Trois applications scientifiques ont servi de bancs d’essai initiaux, chacune comparée à un modèle de référence appelé SwinV2, une architecture d’IA reconnue dans le traitement d’images :
- Prospection de glace lunaire : le modèle réduit l’erreur de localisation des dépôts de glace potentiels de 22 % par rapport au modèle de référence, un gain qui compte, sachant que ces dépôts se cachent souvent dans des régions en ombre permanente, parmi les environnements les plus difficiles à observer de toute la Lune.
- Détection de cratères : à une résolution de 100 mètres par pixel, le modèle améliore la détection de près de 19 % par rapport à la référence, tout en n’utilisant que la moitié des données d’entraînement habituellement nécessaires. À l’échelle du mètre, en revanche, les résultats sont jugés comparables plutôt que supérieurs, un point de nuance important.
- Cartographie des « Irregular Mare Patches » : ces formations volcaniques, dont le nom se traduit approximativement par « taches irrégulières des mers lunaires », bénéficient d’une amélioration plus modeste mais réelle, utile pour retracer l’histoire volcanique et thermique de la Lune.
Sur le plan technique, l’équipe recommande une méthode de réglage fin appelée LoRA (rang 16, alpha 32), appliquée aux couches d’attention et aux blocs de calcul de l’encodeur. Sans entrer dans tous les détails mathématiques, cette approche permet d’adapter le modèle à une tâche précise en n’entraînant qu’une petite fraction de ses paramètres, ce qui rend l’ajustement accessible à des équipes de recherche qui ne disposent pas de la puissance de calcul d’un géant comme IBM.
Pourquoi ces trois cibles précises ?
Le choix de ces trois cas d’usage n’a rien d’anodin : chacun répond à un enjeu concret des futures missions habitées Artemis de la NASA.
- L’eau et l’oxygène potentiellement présents sous forme de glace seront indispensables pour établir une base humaine durable sur la Lune, et pourraient même servir à produire du carburant pour les futures missions vers Mars, repérer précisément ces dépôts est donc une priorité stratégique, pas seulement scientifique.
- L’étude des formations volcaniques aide à comprendre l’histoire thermique de la Lune, mais sert aussi très concrètement à identifier des sites d’atterrissage sûrs pour les futures missions.
- Les cratères, enfin, renseignent sur l’âge des terrains, leur géologie et même la composition chimique de l’intérieur lunaire primitif, tout en permettant d’écarter les zones à risque (pentes raides, blocs rocheux) pour poser un vaisseau ou un équipement en toute sécurité.
Ancienne méthode vs modèle de fondation lunaire
| Méthode traditionnelle | NASA-IBM Lunar Foundation Model | |
| Approche | Analyse manuelle ou un modèle par tâche | Un socle unique, réglé finement selon le besoin |
| Précision à grande échelle | Souvent limitée à basse résolution | Jusqu’à 22 % d’erreur en moins sur la glace |
| Réutilisabilité | Faible, chaque outil est spécifique | Élevée, via un réglage fin (LoRA) léger |
| Accès | Outils internes, dispersés | Ouvert à tous sur Hugging Face et GitHub |
Un vrai bien commun scientifique, avec ses limites assumées
Ce qui distingue cette publication d’un simple communiqué de presse technologique, c’est la conjonction de deux gestes rares réunis dans une même annonce : un modèle d’IA ouvert et un jeu de données scientifiques massif rendu accessible à tous, avec un code reproductible. Dans un paysage de l’IA où l’on parle beaucoup de modèles fermés et de course à la puissance de calcul, ce type de publication, qui s’inscrit dans la continuité de Prithvi et Surya, rappelle qu’une partie significative de la recherche en IA scientifique se construit encore en dehors des grands laboratoires commerciaux fermés, au bénéfice de toute une communauté : universités, start-up, agences spatiales étrangères, ou simples chercheurs indépendants disposant d’un accès à un GPU. La nuance à garder en tête, comme souvent avec ce genre d’annonce, est de ne pas confondre l’amélioration mesurable de certaines tâches (22 % sur la glace, c’est un vrai résultat) avec une révolution qui résoudrait d’un coup toute la complexité de l’exploration lunaire. C’est un outil de recherche puissant, pas une baguette magique et c’est déjà beaucoup.
Tech-Connect Actualités tech, tutoriels et astuces informatiques expliqués simplement