面向外太空应用的 Space-LLaVA:一种视觉语言模型适配器
机器人学
2025-01-22 v2 人工智能
摘要
基础模型(FMs),例如大型语言模型,具备智能属性,这为为机器人赋予理解复杂、非结构化任务所必需的情境理解能力提供了前景。我们看到未来太空机器人人工智能的三个核心挑战,促使我们为太空机器人社区构建一个 FM:1)地面闭环操作的可扩展性;2)将先验知识概括到新环境;3)任务和传感器数据的多模态性。作为构建太空基础模型的第一步,我们以细粒度语言注释编程式地扩展三个外太空数据库,构建包含视觉-问题-答案和视觉-指令跟随元组的合成数据集。我们在增强后的数据集上微调预训练的 LLaVA 13B 检查点,将视觉语言模型(VLM)适配到外太空环境中的视觉语义特征,表明 FMs 可作为专业化工具,提升 VLM 在未见任务类型上的零样本性能,与当前最先进的 VLMs 相比。消融研究表明,同时微调语言 backbone 和视觉语言适配器是关键,以实现适应性,而且仅需少量预训练数据(例如 20%)即可防止灾难性遗忘。
引用
@article{arxiv.2408.05924,
title = {Space-LLaVA: a Vision-Language Model Adapted to Extraterrestrial Applications},
author = {Matthew Foutter and Daniele Gammelli and Justin Kruger and Ethan Foss and Praneet Bhoj and Tommaso Guffanti and Simone D'Amico and Marco Pavone},
journal= {arXiv preprint arXiv:2408.05924},
year = {2025}
}
备注
Accepted to IEEE Aerospace Conference, 23 pages, 18 figures, 3 tables