中文

跨同伦类的迁移强化学习

机器人学 2021-08-10 v3

摘要

机器人将其习得知识迁移到数据稀缺的新任务上的能力,是机器人学习成功的关键挑战。虽然微调作为监督学习背景下简单而有效的迁移方法已被充分研究,但在强化学习背景下尚未得到充分探索。本工作中,我们研究当任务由其奖励函数参数化且奖励函数事先已知时,迁移强化学习中微调的问题。我们推测,当源轨迹与目标轨迹属于不同同伦类时,微调性能会大幅下降。我们证明,与同伦类内微调相比,跨同伦类微调策略参数需要更多与环境的交互,且在某些情况下是不可能的。我们提出一种新颖的微调算法——渐入渐出微调(Ease-In-Ease-Out fine-tuning),由松弛阶段和课程学习阶段组成,以实现跨同伦类的迁移学习。最后,我们在多个受机器人学启发的模拟环境中评估了我们的方法,并经验性地验证了渐入渐出微调方法相比现有基线能以样本高效的方式成功微调。

关键词

引用

@article{arxiv.2102.05207,
  title  = {Transfer Reinforcement Learning across Homotopy Classes},
  author = {Zhangjie Cao and Minae Kwon and Dorsa Sadigh},
  journal= {arXiv preprint arXiv:2102.05207},
  year   = {2021}
}

备注

Accepted by IEEE Robotics and Automation Letters 2021