Lazy loaded image
NASA 联手 IBM 开源月球基础模型,AI 学会给月球找水冰
字数 1734阅读时长≈ 5 分钟
2026-9-11
2026-9-11
2026 年 9 月 10 日,NASA 与 IBM 联合开源了 NASA-IBM 月球基础模型(NASA-IBM Lunar Foundation Model,LFM)。模型权重发布在 Hugging Face,代码在 GitHub 的 NASA-IMPACT 仓库,采用 Apache-2.0 许可,任何人都能下载、微调甚至商用。按两家机构的说法,这是首批专门为月球科学构建的开源 AI 模型之一,也是目前对月球表面刻画得最完整的一个。

月球的数据,早就多到没人看得完

月球勘测轨道器(LRO)绕月飞行 17 年,产出的数据量比其他所有 NASA 行星任务加起来还多,几乎覆盖整颗月球的无缝高分辨率影像。但要用上这些数据,科学家只有两条路:手工翻图比对,或者为单一任务训练一个小模型——算力贵、泛化差、精度也上不去。
更麻烦的是多源异构。GRAIL 的重力场是 20 公里/像素量级,LRO 窄角相机(NAC)能到 1 米/像素,尺度相差四个数量级,模态也完全不同。要把它们放进同一个理解框架,此前根本不存在可用的公共数据集。

做法:把地球观测模型改到月球上

架构不是从零发明的。IBM 选用自家与欧洲空间局(ESA)合用的地球观测模型 TerraMind 的一个版本,转做月球版:编码器与解码器是 ViT-B,预训练输入 256×256 像素、patch 16×16,支持 FlexiViT 弹性缩放;9 种图像模态各配一个 VQ-VAE 分词器(FSQ 量化 + DDPM 解码),再加每片的光学元数据与静态地图上下文,共 11 种模态。
  • 训练用了 16 张 H100 跑 15 万步、全局 batch 1536,总计约 1100 GPU 小时——放在今天的基础模型里是相当克制的预算。
  • 下游适配用 LoRA:冻结基座 90% 的权重,只需少量标注数据就能迁移到新任务。

真正的重头戏,其实是那个数据集

  • SomBench:96.36 万张 WAC(100 米/像素)切片加 100 万张 NAC(约 1 米/像素)切片,合计约 200 万个已配准的图像包。
  • 数据来自 NASA 的 LRO、重力恢复与内部实验室(GRAIL)、月球勘探者号,以及日本 JAXA 的辉夜号(SELENE/Kaguya)。
  • 30 多个空间对齐的数据层、9 台仪器、4 个任务,并按地理分区切分训练与测试集,避免同一地区既训练又测试的数据泄漏。这是第一个能直接喂给现代机器学习框架的开源月球数据集,已集成进开源工具链 TerraTorch。
以前没有一个月球模型能做得又全又强,是因为数据没有被整理成正确的形状。——IBM Research 欧洲、英国及爱尔兰主管 Juan Bernabé-Moreno
他还有一句话更值得记:模型会被更好的模型取代,数据才是真正沉淀下来的东西。

三个优先任务,都被拿去和主流视觉模型对比

  • 月球水冰:永久阴影区里可能藏着水冰,那是饮用水、氧气乃至火箭燃料的来源。模型把识别高潜势区域的均方根误差降低了 22%(对比业界常用的 SwinV2-B)。
  • 陨石坑:1 米/像素下精度与专门训练的 SwinV2-B 持平;在 100 米/像素下反而高出近 19%,而且只用了一半的训练数据。环形山计数是给月面定年的基础手段,也是选择着陆点、避开陡坡与巨石的依据。
  • 火山地貌:识别不规则月海斑块(IMP)比任务专用模型好 3%,成本更低。这些结构看上去很年轻,对既有的月球冷却时间线构成挑战。
官方新闻稿把总体口径写成:在地貌识别上最多领先现有方法 23%。

一次意外的实测:猎鹰九号撞出的新坑

此前一枚 SpaceX 猎鹰九号火箭的上面级撞上月球,NASA 的 LRO 事后拍到了那个约 60 英尺(约 18 米)宽的新鲜陨石坑。IBM 把撞击前后的图像喂给模型,它第一次就正确认出了新坑——即便新坑与一个已有的老坑大幅重叠。Bernabé-Moreno 的评价是:干得非常漂亮。
这说明模型学到的不是「哪里长得像坑」,而是能分辨同一位置在撞击前后的差异。

为什么值得关注

  • 月球南极的水冰直接关系到阿尔忒弥斯计划能否长期驻留:水可以喝,可以电解出氧气,也能做成火箭燃料。把「哪里有冰、冰是否稳定」预测得更准,等于把基地选址的风险降下来。
  • 方法论更值得注意。先是 IBM 与 NASA 的 Prithvi 地球观测模型、太阳物理模型 Surya,现在轮到月球——「一个领域一个基础模型,其余任务靠微调复用」的范式,正从自然语言扩散到科学遥感。
  • 对国内读者也有一层参照:LRO 17 年的公开数据加上开放的模型与数据集,形成了一条「数据—模型—社区」的飞轮。我们也积累了大量遥感与行星数据,如何把它们整理成机器学习可用的统一数据集,可能比把模型参数堆得更大更关键。
也要泼一点冷水:官方自己称这是对 PB 级卫星数据的「第一版翻译」,上述精度数字全部来自 NASA 与 IBM 自己的评测基准,尚无第三方独立复现。
💡
一句话总结:这次发布最值钱的可能不是模型,而是那个约 200 万片、30 多层、横跨 4 个任务拼起来的开源月球数据集——模型会过时,数据不会。

参考来源

  • NASA Science:NASA, IBM Launch AI Foundation Model for Lunar Science(science.nasa.gov)
  • IBM Research Blog:Introducing IBM and NASA's new foundation model for the Moon(research.ibm.com)
  • PR Newswire 新闻稿:IBM and NASA Release Open-Source AI Model to Support Lunar Exploration
  • Hugging Face 模型卡:NASA-IBM Lunar Foundation Model(nasa-ibm-ai4science)
  • Engadget:NASA and IBM made an AI model for exploring the Moon
上一篇
Apple Watch S12:心率 5 秒一测,手表开卖血液检测
下一篇
苹果首款折叠屏 iPhone Duo 发布:1999 美元起售