中文

UNeMo:通过多模态世界模型实现的协作式视觉-语言推理与导航

人工智能 2026-02-10 v2

摘要

视觉-语言导航(VLN)需要智能体通过视觉图像和自然语言指令在复杂环境中自主导航——这一点始终具有挑战性。最近的研究表明,使用预训练的大型语言模型(LLM)增强语言引导导航推理具有前景。然而,这些方法的推理仅限于语言模态,缺乏视觉推理能力。此外,现有的推理模块与导航策略分开优化,导致目标不兼容且可能存在冲突。为了解决这些挑战,我们引入了UNeMo,一个用于视觉状态推理和导航决策协作优化的新框架。它引入了一个多模态世界模型(MWM),该模型将视觉特征、语言指令和导航动作作为输入,联合预测后续视觉状态,从而实现跨模态推理。通过层次预测-反馈(HPN)机制,MWM与导航策略协作:第一层使用当前视觉-语言特征生成动作;MWM 然后推断事后视觉状态以指导第二层的细粒度决策。这形成了一个动态的双向促进机制,其中 MWM 推理优化导航策略,而策略决策反馈改进 MWM 的推理准确性。在 R2R 和 REVERIE 数据集上的实验表明,UNeMo 在不可见场景的导航准确率上分别超过了最先进的方法2.1%和0.7%,验证了其有效性。

关键词

引用

@article{arxiv.2511.18845,
  title  = {UNeMo: Collaborative Visual-Language Reasoning and Navigation via a Multimodal World Model},
  author = {Changxin Huang and Lv Tang and Zhaohuan Zhan and Lisha Yu and Runhao Zeng and Zun Liu and Zhengjie Wang and Jianqiang Li},
  journal= {arXiv preprint arXiv:2511.18845},
  year   = {2026}
}