中文

基于离线数据且无需高覆盖度来缓解模仿学习中的协变量偏移

机器学习 2022-02-01 v3 机器学习

摘要

本文研究离线模仿学习(IL),其中智能体在不进行额外在线环境交互的情况下学习模仿专家演示者。相反,学习者获得一个静态离线数据集,其中包含来自可能不够熟练的行为策略的状态-动作-下一状态转移三元组。我们提出基于模型的离线数据模仿学习(MILO):一种利用静态数据集在理论与实践中均高效解决离线 IL 问题的算法框架。在理论上,即使行为策略相比专家高度次优,我们表明只要行为策略的数据在专家状态-动作轨迹上提供充分覆盖(而无需对整个状态-动作空间有全局覆盖),MILO 就能可证明地应对 IL 中的协变量偏移问题。作为理论结果的补充,我们还展示了我们方法的一个实际实现在基准 MuJoCo 连续控制任务上缓解了协变量偏移。我们证明,在行为策略性能不足专家一半的情况下,MILO 仍能用极少数量的专家状态-动作对成功模仿,而传统离线 IL 方法如行为克隆(BC)则完全失败。源代码见 https://github.com/jdchang1/milo。

关键词

引用

@article{arxiv.2106.03207,
  title  = {Mitigating Covariate Shift in Imitation Learning via Offline Data Without Great Coverage},
  author = {Jonathan D. Chang and Masatoshi Uehara and Dhruv Sreenivas and Rahul Kidambi and Wen Sun},
  journal= {arXiv preprint arXiv:2106.03207},
  year   = {2022}
}

备注

42 pages, 5 figures, 7 tables