中文

GoViG:基于多模态推理的目标条件视觉导航指令生成

计算机视觉与模式识别 2026-04-30 v2 人工智能

摘要

我们提出了目标条件视觉导航指令生成(Goal-Conditioned Visual Navigation Instruction Generation, GoViG),这是一项全新任务,旨在仅从初始状态和目标状态的第三人称视觉观察中生成具有上下文一致性的导航指令。与依赖结构化输入(如语义标注或环境地图)的先前工作不同,GoViG仅利用原始第三人称视觉数据,提高了对未见及非结构化环境的适应性。我们的方法通过将该任务分解为两个相互关联的子任务来实现:(1)导航可视化,预测连接初始和目标视图之间的中间视觉状态;(2)指令生成,综合观察到的和预期的视觉信息,生成连贯的指令。两个子任务均集成于一个基于自回归多模态大语言模型中,通过量身定制的目标确保空间准确性和语言清晰性。此外,我们引入两种多模态推理策略,即单次推理和交错推理,以模拟人类导航认知的逐步过程。为全面评估我们的方法,我们提出了 R2R-Goal 数据集,包含多样化的合成和真实世界轨迹。实验结果表明,在 BLEU-4 和 CIDEr 分数方面,本方法相较于最先进的方法实现了显著的性能提升,并展现出强大的跨域泛化能力。

关键词

引用

@article{arxiv.2508.09547,
  title  = {GoViG: Goal-Conditioned Visual Navigation Instruction Generation via Multimodal Reasoning},
  author = {Fengyi Wu and Yifei Dong and Yilong Dai and Guangyu Chen and Qifeng Wu and Huiting Huang and Hang Wang and Qi Dai and Alexander G. Hauptmann and Zhi-Qi Cheng},
  journal= {arXiv preprint arXiv:2508.09547},
  year   = {2026}
}

备注

Accepted to ACL 2026 Findings. 22 pages, 12 figures, Code: https://github.com/F1y1113/GoViG