ALFRED:一个用于解释日常任务中具身指令的基准
计算机视觉与模式识别
2020-04-01 v2 人工智能
计算与语言
机器学习
机器人学
摘要
我们提出 ALFRED(Action Learning From Realistic Environments and Directives,从真实环境与指令中学习动作),这是一个用于学习从自然语言指令和以自我为中心的视觉到家庭任务动作序列映射的基准。ALFRED 包含具有不可逆状态变化的长时间组合任务,以缩小研究基准与真实世界应用之间的差距。ALFRED 由 25k 条自然语言指令在交互式视觉环境中的专家演示组成。这些指令既包含如“冲洗一个杯子并将其放入咖啡机”这样的高层目标,也包含如“走到右边的咖啡机”这样的低层语言指令。在序列长度、动作空间与语言方面,ALFRED 任务比现有的视觉与语言任务数据集更为复杂。我们展示了一个基于近期具身视觉与语言任务的基线模型在 ALFRED 上表现不佳,表明利用该基准开发创新的具身视觉语言理解模型仍有显著空间。
引用
@article{arxiv.1912.01734,
title = {ALFRED: A Benchmark for Interpreting Grounded Instructions for Everyday Tasks},
author = {Mohit Shridhar and Jesse Thomason and Daniel Gordon and Yonatan Bisk and Winson Han and Roozbeh Mottaghi and Luke Zettlemoyer and Dieter Fox},
journal= {arXiv preprint arXiv:1912.01734},
year = {2020}
}
备注
Computer Vision and Pattern Recognition (CVPR) 2020 ; https://askforalfred.com/