中文

视觉想象是否能提高视觉-语言导航智能体的表现?

计算机视觉与模式识别 2025-03-21 v1 人工智能 计算与语言 机器人学

摘要

视觉-语言导航 (VLN) 智能体需通过自然语言指令在未见环境中进行导航。本文研究视觉表示的子目标(由指令暗示)是否可作为导航线索并提升导航性能。为合成这些视觉表示或想象,我们利用文本到图像扩散模型对分段指令中包含的地标参考进行处理。这些想象被提供给 VLN 智能体作为额外模态,用作地标线索,并添加额外损失以明确鼓励将其与相应指代表达式关联。我们的发现显示,成功率 (SR) 增加约 1 分,按路径长度比例缩放的成功率 (SPL) 最多提升 0.5 分。这些结果表明,所提方法相较于仅依赖语言指令,强化了视觉理解。

关键词

引用

@article{arxiv.2503.16394,
  title  = {Do Visual Imaginations Improve Vision-and-Language Navigation Agents?},
  author = {Akhil Perincherry and Jacob Krantz and Stefan Lee},
  journal= {arXiv preprint arXiv:2503.16394},
  year   = {2025}
}