中文

ArraMon:动态环境中联合导航-组装指令理解任务

计算与语言 2020-11-17 v1 人工智能 计算机视觉与模式识别 机器人学

摘要

对于具身智能体,导航是一项重要能力但并非孤立目标。智能体还被期望在到达目标位置后执行特定任务,例如拾取物体并将其组装成特定排列。我们结合视觉与语言导航、所收集物体的组装,以及物体指代表达理解,创建了一个名为ArraMon的新颖联合导航-组装任务。在此任务中,智能体(类似于PokeMON GO玩家)被要求在复杂、真实的户外环境中基于自然语言指令逐一寻找并收集不同目标物体,随后还需在以自我为中心的网格布局环境中将收集到的物体逐部分进行ARRAnge(排列)。为支持该任务,我们实现了一个3D动态环境模拟器,并收集了一个包含人类撰写的导航与组装指令及相应真实轨迹的数据集(英文;并扩展至印地语)。我们还通过验证阶段对收集的指令进行筛选,最终得到总计7.7K个任务实例(30.8K条指令与路径)。我们给出了若干基线模型(集成与有偏)和指标(nDTW、CTC、rPOD和PTC)的结果,模型与人类之间的巨大性能差距表明我们的任务具有挑战性且为未来工作提供了广阔空间。我们的数据集、模拟器与代码公开于:https://arramonunc.github.io

关键词

引用

@article{arxiv.2011.07660,
  title  = {ArraMon: A Joint Navigation-Assembly Instruction Interpretation Task in Dynamic Environments},
  author = {Hyounghun Kim and Abhay Zala and Graham Burri and Hao Tan and Mohit Bansal},
  journal= {arXiv preprint arXiv:2011.07660},
  year   = {2020}
}

备注

EMNLP Findings 2020 (18 pages; extended to Hindi)