中文

基于真实室内导览视频的多模态事件知识增强视觉语言导航

机器人学 2026-03-02 v1 计算机视觉与模式识别

摘要

视觉语言导航 (VLN) 智能体在未见环境中面对模糊指令时常难以进行长程推理,尤其是在面对歧义性、粗粒度指令时。虽然近期研究通过知识图谱增强推理,但受人类情景记忆启发的多模态事件知识潜力仍未得到充分探索。本文提出一种以事件为中心的知识增强策略,用于自动化过程知识的挖掘与特征融合,以解决 VLN 任务中的粗粒度指令和长程推理问题。首先,我们构建了 YE-KG,这是第一个大规模多模态时空知识图谱,包含超过 86,000 个节点和 83,000 条边,源自真实室内视频。通过利用多模态大语言模型 (如 LLaVa、GPT4),我们将非结构化视频流提取为结构化的语义-动作-效果事件,以充当显式情景记忆。其次,我们引入了 STE-VLN,通过粗到细层次检索机制将上述知识图谱集成到 VLN 模型中。这使得智能体能够检索因果事件序列,并动态地将其与本体视觉观察融合。在 REVERIE、R2R 和 R2R-CE 数据集上的实验表明,我们的事件中心策略有效,全面超越现有最先进方法。我们的数据和代码已在项目网站 https://sites.google.com/view/y-event-kg/ 上提供。

关键词

引用

@article{arxiv.2602.23937,
  title  = {Enhancing Vision-Language Navigation with Multimodal Event Knowledge from Real-World Indoor Tour Videos},
  author = {Haoxuan Xu and Tianfu Li and Wenbo Chen and Yi Liu and Xingxing Zuo and Yaoxian Song and Haoang Li},
  journal= {arXiv preprint arXiv:2602.23937},
  year   = {2026}
}