基于连续性纠正标签的数据高效精细操作行为克隆
机器人学
2024-10-22 v3
摘要
我们考虑仅使用专家演示的模仿学习,其实际应用通常因执行过程中累积误差导致的协变量偏移而受限。我们研究了基于连续性的纠正标签用于模仿学习(CCIL)框架在缓解这一问题上对真实世界精细操作任务的有效性。CCIL通过从演示中学习局部连续动力学模型来生成纠正标签,引导智能体返回专家状态。通过在插销插入和精细抓取上的大量实验,我们首次实证验证了CCIL即使在接触丰富的操作中存在不连续性时也能显著提高模仿学习性能。我们发现:(1)真实世界操作表现出足够的局部光滑性以应用CCIL,(2)生成的纠正标签在低数据情况下最有益,(3)基于估计的动力学模型误差的标签过滤能够带来性能提升。为了将CCIL有效应用于机器人领域,我们提供了该框架的实用实例化以及关于设计选择和超参数选择的见解。我们的工作展示了CCIL在物理机器人上减轻模仿学习中累积误差的实用性。
引用
@article{arxiv.2405.19307,
title = {Data Efficient Behavior Cloning for Fine Manipulation via Continuity-based Corrective Labels},
author = {Abhay Deshpande and Liyiming Ke and Quinn Pfeifer and Abhishek Gupta and Siddhartha S. Srinivasa},
journal= {arXiv preprint arXiv:2405.19307},
year = {2024}
}
备注
Presented at IROS 2024