OpenMap:通过开放词汇视觉语言映射实现指令对齐
机器人学
2025-08-05 v1
摘要
将自然语言指令与视觉观察对齐是构筑于开放世界环境中作战智能体的基本任务。近期的视觉语言映射进展已通过利用视觉语言模型(VLMs)实现了通用可解释的语义表示。然而,这些方法常因实例级语义一致性和指令解释的局限性,难以将自由形式的语言命令与具体场景实例对齐。我们提出了 OpenMap,一个零样本开放词汇视觉语言地图,旨在导航任务中实现精准指令对齐。为解决跨视角的语义不一致问题,我们引入结构语义共识约束,联合考虑全局几何结构和视觉语言相似性,以引导稳健的三维实例级聚合。为提高指令解释,我们提出了由 LLM 支持的指令到实例对齐模块,利用空间上下文和富有表现力的目标描述实现精细的实例选择。我们在 ScanNet200 和 Matterport3D 上评估了 OpenMap,涵盖语义映射和指令到目标检索任务。实验结果表明,OpenMap 在零样本设置下超越了最先进的基线,展示了在构筑自由形式语言与三维感知之间起作用的有效性。
引用
@article{arxiv.2508.01723,
title = {OpenMap: Instruction Grounding via Open-Vocabulary Visual-Language Mapping},
author = {Danyang Li and Zenghui Yang and Guangpeng Qi and Songtao Pang and Guangyong Shang and Qiang Ma and Zheng Yang},
journal= {arXiv preprint arXiv:2508.01723},
year = {2025}
}
备注
ACM MM '25