中文

基于递减相对纠正的在线模仿学习用于操作

机器人学 2025-03-20 v1 机器学习

摘要

远程操控机器人操作臂允许收集演示数据,可用于通过模仿学习训练控制策略。然而,这些方法需要大量训练数据才能开发出稳健的策略或适应新型且未遇到的任务。虽然专家反馈可以显著提高策略性能,但持续提供反馈对专家来说会是认知负担和时间消耗。为此,我们提出使用一种可为策略模型生成的轨迹提供 6 自由度空间纠正的电缆驱动遥操作系统。具体而言,我们提出一种称为递减相对纠正 (DRC) 的纠正方法,该方法基于专家提供的空间偏移向量,暂时存在,并减少专家所需的干预步骤。我们的结果表明,DRC 比标准绝对纠正方法将所需的专家干预率降低了 30%。此外,我们展示了将 DRC 集成到在线模仿学习框架中后,能快速提高操作任务(如树莓果采收和布帘擦拭)的成功率。

关键词

引用

@article{arxiv.2503.15368,
  title  = {Online Imitation Learning for Manipulation via Decaying Relative Correction through Teleoperation},
  author = {Cheng Pan and Hung Hon Cheng and Josie Hughes},
  journal= {arXiv preprint arXiv:2503.15368},
  year   = {2025}
}