Room-Across-Room:具有稠密时空定位的多语言视觉与语言导航
计算机视觉与模式识别
2020-10-19 v1 人工智能
计算与语言
摘要
我们引入 Room-Across-Room (RxR),一个新的视觉与语言导航 (VLN) 数据集。RxR 是多语言的(英语、印地语和泰卢固语)且比其他 VLN 数据集更大(更多路径与指令)。它通过解决路径中的已知偏差并引出更多对可见实体的指代,强调了语言在 VLN 中的作用。此外,指令中的每个词都与指令创建者与验证者的虚拟位姿时间对齐。我们建立了单语言与多语言设置以及包含 Room-to-Room 标注时的多任务学习的基线分数。我们还提供了一个从同步位姿轨迹学习的模型结果,该模型仅关注人类演示中所注意的全景部分。RxR 的规模、范围与细节极大地拓展了在模拟照片级真实环境中具身语言智能体研究的前沿。
引用
@article{arxiv.2010.07954,
title = {Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding},
author = {Alexander Ku and Peter Anderson and Roma Patel and Eugene Ie and Jason Baldridge},
journal= {arXiv preprint arXiv:2010.07954},
year = {2020}
}
备注
EMNLP 2020