中文

面向月球探索的大语言视觉助手 LLaVA-LE

计算机视觉与模式识别 2026-03-27 v1

摘要

最近的多模态视觉语言模型 (VLM) 进展使其能够对视觉和文本信息进行联合推理,然而其在行星科学中的应用仍鲜有探索。一个关键障碍是缺乏大规模将真实行星图像与详细科学描述配对的数据集。本文引入 LLaVA-LE (Large Language-and-Vision Assistant for Lunar Exploration), 一个专用于月球表面和 subsurface 特征表征的视觉语言模型。为实现此功能,我们构建了一个新的大规模多模态月球数据集 LUCID (LUnar Caption Image Dataset),包含 96k 高分辨率 Panchromatic 图像,配有描述月球地形特征的详细标题;以及 81k 问答 (QA) 对,源自约 20k 张 LUCID 数据集中的图像。利用该数据集,我们采用两阶段训练课程进行微调: (1) 针对特定地形描述的概念对齐; (2) 指令微调的视觉问答。我们进一步设计了覆盖多个推理复杂度水平的评估基准,这些基准与月球地形分析相关。相对于 GPT 和 Gemini 裁判员,LAVA-LE 相较于 Base LAVA 和我们的 Stage 1 模型实现了 3.3 倍和 2.1 倍的整体性能提升,推理得分达 1.070,超过裁判员的参考得分,凸显了特定领域多模态数据和指令微调在推进行星探索 VLM 方面的有效性。代码可在 https://github.com/OSUPCVLab/LLaVA-LE 获取。

关键词

引用

@article{arxiv.2603.24696,
  title  = {LLaVA-LE: Large Language-and-Vision Assistant for Lunar Exploration},
  author = {Gokce Inal and Pouyan Navard and Alper Yilmaz},
  journal= {arXiv preprint arXiv:2603.24696},
  year   = {2026}
}

备注

Accepted in AI4Space Workshop CVPR2026. Website: https://osupcvlab.github.io/LLaVA-LE/, Dataset: https://huggingface.co/datasets/pcvlab/lucid