超越文本知识:利用多模态知识库增强视觉-语言导航
计算机视觉与模式识别
2026-03-31 v1 人工智能
图像与视频处理
摘要
视觉-语言导航(VLN)要求智能体基于自然语言指令在复杂未见环境中导航。然而,现有方法通常难以有效捕捉关键语义线索并将其与视觉观测准确对齐。为解决这一局限,我们提出了超越文本知识(BTK),一个VLN框架,协同整合环境特异性文本知识与生成式图像知识库。BTK使用Qwen3-4B提取目标相关短语,并利用Flux-Schnell构建两个大规模图像知识库:R2R-GP和REVERIE-GP。此外,我们利用BLIP-2从全景视图构建大规模文本知识库,提供环境特异性语义线索。这些多模态知识库通过目标感知增强器和知识增强器有效整合,显著增强了语义锚定和跨模态对齐。在R2R数据集的7,189条轨迹和REVERIE数据集的21,702条指令上的广泛实验表明,BTK显著优于现有基线。在R2R和REVERIE的测试未见分割上,SR分别提高了5%和2.07%,SPL分别提高了4%和3.69%。源代码在https://github.com/yds3/IPM-BTK/上公开可用。
引用
@article{arxiv.2603.26859,
title = {Beyond Textual Knowledge-Leveraging Multimodal Knowledge Bases for Enhancing Vision-and-Language Navigation},
author = {Dongsheng Yang and Yinfeng Yu and Liejun Wang},
journal= {arXiv preprint arXiv:2603.26859},
year = {2026}
}
备注
Main paper (37 pages). Accepted for publication by the Information Processing and Management,Volume 63,Issue 6,September 2026,104766