中文

我们到了吗?具身指令跟随中的定位学习

人工智能 2021-01-12 v1 计算与语言 计算机视觉与模式识别 机器人学

摘要

具身指令跟随是一个具有挑战性的问题,要求智能体从复杂的语言与视觉输入中推断出一序列基本动作,以实现目标环境状态。Action Learning From Realistic Environments and Directives (ALFRED) 是近期提出的该问题基准,由逐步自然语言指令组成以实现子目标,这些子目标组合成一个最终高层目标。该任务的关键挑战包括通过视觉输入定位目标位置并导航至该处,以及将语言指令 grounding 到物体的视觉外观。为应对这些挑战,本研究中我们在导航子目标期间以多个视角扩充智能体的视野,并训练智能体在每时间步预测其相对于目标位置的空间关系。我们还通过向模型流水线引入预训练物体检测模块来改进语言 grounding。实证研究表明,我们的方法超越了基线模型性能。

关键词

引用

@article{arxiv.2101.03431,
  title  = {Are We There Yet? Learning to Localize in Embodied Instruction Following},
  author = {Shane Storks and Qiaozi Gao and Govind Thattai and Gokhan Tur},
  journal= {arXiv preprint arXiv:2101.03431},
  year   = {2021}
}

备注

Accepted to HAI @ AAAI 2021