视觉与对话导航
计算与语言
2019-10-15 v3 人工智能
计算机视觉与模式识别
机器人学
摘要
在人类环境中导航的机器人应当使用语言请求协助,并能够理解人类的回应。为研究这一挑战,我们引入了协作视觉与对话导航(Cooperative Vision-and-Dialog Navigation),这是一个包含超过 2k 个具身化、人—人对话的数据集,场景设定于模拟的、照片级真实感的家居环境中。导航者(Navigator)向其伙伴预言者(Oracle)提问,后者根据最短路径规划器拥有导航者应采取的最佳下一步的特权访问权限。为训练在环境中搜索目标位置的智能体,我们定义了基于对话历史导航(Navigation from Dialog History)任务。给定目标物体以及人类为找到该物体而协作的对话历史,智能体必须在未探索环境中推断朝向目标的导航动作。我们建立了一个初始的多模态序列到序列模型,并证明在对话历史中回溯更远可提升性能。源代码与在线交互演示可在 https://cvdn.dev/ 获取。
引用
@article{arxiv.1907.04957,
title = {Vision-and-Dialog Navigation},
author = {Jesse Thomason and Michael Murray and Maya Cakmak and Luke Zettlemoyer},
journal= {arXiv preprint arXiv:1907.04957},
year = {2019}
}
备注
Conference on Robot Learning (CoRL) 2019