中文

Mem2Ego: 基于全局到本体记忆赋能视觉语言模型用于长时程具身导航

机器人学 2025-06-12 v2 人工智能

摘要

近期,大型语言模型(LLM)和视觉语言模型(VLM)的快速发展使其成为具身导航中强大的工具,使代理能够利用常识和空间推理,在不熟悉的环境中高效探索。现有的LLM方法将全局记忆(如语义或拓扑地图)转换为语言描述以指导导航。虽然这提高了效率并减少了冗余探索,但基于语言的表征丢失了几何信息,限制了在复杂环境中的空间推理。为此,VLM方法直接处理本体中心视觉输入以选择探索的最优方向。然而,仅依赖第一人称视角会使导航成为部分观察到的决策问题,导致在复杂环境中出现次优决策。本文提出一种新型视觉语言模型(VLM)基于导航框架,以适应性方式从全局记忆模块中检索与任务相关线索,并与代理的本体中心观察集成。通过动态对齐全局上下文信息与局部感知,本方法增强了在长时程任务中的空间推理和决策能力。实验结果表明,所提方法在对象导航任务中超越了之前的状态-of-the-art方法,为具身导航提供了更有效且可扩展的解决方案。

关键词

引用

@article{arxiv.2502.14254,
  title  = {Mem2Ego: Empowering Vision-Language Models with Global-to-Ego Memory for Long-Horizon Embodied Navigation},
  author = {Lingfeng Zhang and Yuecheng Liu and Zhanguang Zhang and Matin Aghaei and Yaochen Hu and Hongjian Gu and Mohammad Ali Alomrani and David Gamaliel Arcos Bravo and Raika Karimi and Atia Hamidizadeh and Haoping Xu and Guowei Huang and Zhanpeng Zhang and Tongtong Cao and Weichao Qiu and Xingyue Quan and Jianye Hao and Yuzheng Zhuang and Yingxue Zhang},
  journal= {arXiv preprint arXiv:2502.14254},
  year   = {2025}
}