少即是多:基于地标生成有依据的导航指令
计算机视觉与模式识别
2022-04-06 v4 计算与语言
摘要
我们研究了从室内路径上捕获的360度图像自动生成导航指令的问题。现有的生成器存在视觉依据性差的问题,导致它们依赖语言先验并产生幻觉物体。我们的MARKY-MT5系统通过聚焦于视觉地标来解决这个问题;它包含一个第一阶段地标检测器和一个第二阶段生成器——一个多模态、多语言、多任务的编码器-解码器。为了训练它,我们在Room-across-Room (RxR) 数据集上自助构建了有依据的地标标注。利用文本解析器、来自RxR位姿轨迹的弱监督以及一个在18亿张图像上训练的多语言图像-文本编码器,我们识别出97.1万个英语、印地语和泰卢固语的地标描述,并将它们与全景图中的特定区域建立关联。在Room-to-Room数据集上,人类寻路者遵循MARKY-MT5指令的成功率(SR)为71%,略低于遵循人类指令的75% SR,但远高于其他生成器的SR。在RxR更长、更多样化的路径上评估,三种语言的SR达到61-64%。在新环境中生成如此高质量的导航指令是迈向对话式导航工具的一步,并可能促进指令遵循智能体的大规模训练。
引用
@article{arxiv.2111.12872,
title = {Less is More: Generating Grounded Navigation Instructions from Landmarks},
author = {Su Wang and Ceslee Montgomery and Jordi Orbay and Vighnesh Birodkar and Aleksandra Faust and Izzeddin Gur and Natasha Jaques and Austin Waters and Jason Baldridge and Peter Anderson},
journal= {arXiv preprint arXiv:2111.12872},
year = {2022}
}
备注
CVPR 2022 Camera-ready