中文

基于效果循环一致性的跨领域策略迁移

机器人学 2024-03-05 v1 人工智能

摘要

由于样本效率低下,使用深度强化学习方法从头训练机器人策略的成本可能极高。为了应对这一挑战,将源领域中训练的策略迁移到目标领域成为一种极具吸引力的范式。以往的研究通常关注具有相似状态空间和动作空间但在其他方面存在差异的领域。本文主要关注具有不同状态空间和动作空间的领域,这在实践中具有更广泛的意义,即将策略从机器人 A 迁移到机器人 B。与以往依赖配对数据的方法不同,我们提出了一种利用非配对数据学习跨领域状态空间与动作空间之间映射函数的新方法。我们提出了效果循环一致性,通过对称优化结构对齐两个领域间状态转移的效果,从而学习这些映射函数。一旦映射函数学习完成,我们即可将策略从源领域无缝迁移到目标领域。我们的方法已在三个运动任务和两个机器人操作任务上进行了测试。实验结果表明,与 state-of-the-art 方法相比,我们的方法能显著降低对齐误差并取得更好的性能。

关键词

引用

@article{arxiv.2403.02018,
  title  = {Cross Domain Policy Transfer with Effect Cycle-Consistency},
  author = {Ruiqi Zhu and Tianhong Dai and Oya Celiktutan},
  journal= {arXiv preprint arXiv:2403.02018},
  year   = {2024}
}

备注

Accepted to International Conference on Robotics and Automation (ICRA), 2024