中文

CCIL:基于连续性的纠错模仿学习数据增强方法

机器人学 2024-06-05 v2

摘要

我们提出了一种新技术,通过生成纠错数据来考虑复合误差与干扰,从而增强模仿学习方法的鲁棒性。现有方法依赖于交互式专家标注、额外的离线数据集或领域特定的不变性,而我们的方法除可获取专家数据外仅需极少的额外假设。其核心思路是利用环境动力学中的局部连续性来生成纠错标签。我们的方法首先从专家演示中构建动力学模型,并在所学模型中鼓励局部 Lipschitz 连续性。在局部连续区域中,该模型使我们能够在演示的邻域内、但超出数据集中实际状态与动作集合的范围生成纠错标签。在此增强数据上训练可提升智能体从扰动中恢复和处理复合误差的能力。我们在仿真中多种具有不同连续与间断形式的机器人学领域(包括经典控制问题、无人机飞行、高维传感器观测下的导航、腿式运动以及桌面操作)通过实验证明了所生成标签的有效性。

关键词

引用

@article{arxiv.2310.12972,
  title  = {CCIL: Continuity-based Data Augmentation for Corrective Imitation Learning},
  author = {Liyiming Ke and Yunchu Zhang and Abhay Deshpande and Siddhartha Srinivasa and Abhishek Gupta},
  journal= {arXiv preprint arXiv:2310.12972},
  year   = {2024}
}