ARNOLD:真实三维场景中基于语言接地的连续状态任务学习基准
人工智能
2023-09-12 v2 计算与语言
计算机视觉与模式识别
机器人学
摘要
理解物体的连续状态对于现实世界中的任务学习与规划至关重要。然而,大多数现有任务学习基准假设离散(如二值)物体目标状态,这为复杂任务的学习以及将所学策略从仿真环境迁移到现实世界带来挑战。此外,状态离散化限制了机器人基于动作与状态接地来遵循人类指令的能力。为应对这些挑战,我们提出 ARNOLD,一个评估真实三维场景中基于语言接地的连续状态任务学习的基准。ARNOLD 包含 8 个语言条件任务,涉及理解物体状态并为连续目标学习策略。为促进语言指令学习,我们提供带模板生成语言描述的专家演示。我们利用最新的语言条件策略学习模型评估任务表现。我们的结果表明,当前语言条件操纵模型在新型目标状态泛化、场景泛化和物体泛化方面仍面临显著挑战。这些发现凸显了开发新算法以弥补此差距的必要性,并强调了该领域进一步研究的潜力。项目网站:https://arnold-benchmark.github.io。
引用
@article{arxiv.2304.04321,
title = {ARNOLD: A Benchmark for Language-Grounded Task Learning With Continuous States in Realistic 3D Scenes},
author = {Ran Gong and Jiangyong Huang and Yizhou Zhao and Haoran Geng and Xiaofeng Gao and Qingyang Wu and Wensi Ai and Ziheng Zhou and Demetri Terzopoulos and Song-Chun Zhu and Baoxiong Jia and Siyuan Huang},
journal= {arXiv preprint arXiv:2304.04321},
year = {2023}
}
备注
The first two authors contributed equally; 20 pages; 17 figures; project availalbe: https://arnold-benchmark.github.io/ ICCV 2023