中文

你在哪里?基于具身对话的定位

计算机视觉与模式识别 2021-09-06 v2 计算与语言

摘要

我们提出“你在哪里?”(Where Are You?, WAY)数据集,包含约 6k 段对话,其中两名人类——观察者(Observer)与定位者(Locator)——完成一项协作式定位任务。观察者在三维环境中随机生成,可从第一人称视角进行导航,同时回答定位者的问题。定位者必须通过提问和发出指令,在详细的俯视地图中定位观察者。基于该数据集,我们定义了三项具有挑战性的任务:基于具身对话的定位(Localization from Embodied Dialog, LED)(根据对话历史定位观察者)、具身视觉对话(对观察者建模)以及协作式定位(对两个智能体建模)。本文聚焦于 LED 任务——提供了一个强基线模型,并通过详细的消融实验刻画了数据集偏差以及各种建模选择的重要性。我们的最佳模型在未见建筑中将观察者位置识别在 3m 以内的成功率为 32.7%,而人类定位者为 70.4%。

关键词

引用

@article{arxiv.2011.08277,
  title  = {Where Are You? Localization from Embodied Dialog},
  author = {Meera Hahn and Jacob Krantz and Dhruv Batra and Devi Parikh and James M. Rehg and Stefan Lee and Peter Anderson},
  journal= {arXiv preprint arXiv:2011.08277},
  year   = {2021}
}