中文

基于观测的模仿学习及其自动折扣调度

机器人学 2024-02-08 v3 人工智能 机器学习

摘要

人类常通过观察与模仿习得新技能。对于机器人智能体,从互联网上大量无标注视频演示数据中学习,需要在无法获取专家动作的情况下进行模仿,这构成了被称为基于观测的模仿学习(ILfO)的挑战。解决 ILfO 问题的常见方法是将其转化为逆强化学习问题,利用由智能体与专家观测计算的代理奖励。然而,我们指出具有进度依赖特性的任务对此类方法构成重大挑战;在此类任务中,智能体需先学习专家的前序行为,再掌握后续行为。我们的研究表明,主因是分配给后续步骤的奖励信号阻碍了初始行为的学习。为应对该挑战,我们提出一种新颖的 ILfO 框架,使智能体在进阶后续行为前先掌握更早的行为。我们引入自动折扣调度(ADS)机制,在训练阶段自适应改变强化学习中的折扣因子,初始优先早期奖励,仅当早期行为掌握后才逐步引入后期奖励。我们在九个 Meta-World 任务上的实验表明,本方法在所有任务上显著优于最先进方法,包括那些它们无法解决的任务。

关键词

引用

@article{arxiv.2310.07433,
  title  = {Imitation Learning from Observation with Automatic Discount Scheduling},
  author = {Yuyang Liu and Weijun Dong and Yingdong Hu and Chuan Wen and Zhao-Heng Yin and Chongjie Zhang and Yang Gao},
  journal= {arXiv preprint arXiv:2310.07433},
  year   = {2024}
}

备注

Accepted by ICLR 2024