从离线数据与众包标注中学习语言条件的机器人行为
机器人学
2021-11-02 v2 人工智能
机器学习
摘要
我们研究从一个大型机器人交互离线数据集中学习一系列基于视觉的操作任务的问题。为此,人类需要向机器人指定任务的简便且有效的方式。目标图像是一种流行的任务指定形式,因为它们已立足于机器人的观测空间。然而,目标图像也有若干缺点:它们不便于人类提供,可能过度指定期望行为导致稀疏奖励信号,或在非目标到达任务情形下欠指定任务信息。自然语言提供了便捷灵活的任务指定替代方案,但面临将语言在机器人观测空间中落地的挑战。为可扩展地学习此种落地,我们提议利用离线机器人数据集(包括高度次优、自主收集的数据)与众包自然语言标签。利用该数据,我们学习一个简单分类器,预测状态变化是否完成一条语言指令。这提供了一个语言条件的奖励函数,可用于离线多任务 RL。在实验中,我们发现,在语言条件的操作任务上,我们的方法比目标图像指定和语言条件模仿技术均高出 25% 以上,并能在 Franka Emika Panda 机器人上执行如“打开右边抽屉”和“移动订书机”等自然语言视觉运动任务。
引用
@article{arxiv.2109.01115,
title = {Learning Language-Conditioned Robot Behavior from Offline Data and Crowd-Sourced Annotation},
author = {Suraj Nair and Eric Mitchell and Kevin Chen and Brian Ichter and Silvio Savarese and Chelsea Finn},
journal= {arXiv preprint arXiv:2109.01115},
year = {2021}
}
备注
Conference on Robot Learning (CoRL) 2021. 24 Pages, 18 Figures