中文

基于 Boosting 的对抗模仿学习

机器学习 2024-04-15 v1 人工智能

摘要

对抗模仿学习(AIL)在各种模仿学习(IL)应用中作为一种主导框架脱颖而出,其中判别器-演员-评论家(DAC)(Kostrikov et al., 2019) 证明了离策略学习算法在提高样本效率和向高维观测可扩展性方面的有效性。尽管 DAC 取得了经验上的成功,但原始的 AIL 目标是在策略的,且 DAC 对离策略训练的临时应用并不能保证模仿成功 (Kostrikov et al., 2019; 2020)。后续工作如 ValueDICE (Kostrikov et al., 2020) 通过推导完全离策略的 AIL 目标来解决这一问题。而在本工作中,我们通过 boosting 框架开发了一种新颖且有原则的 AIL 算法。与 boosting 类似,我们的新算法 AILBoost 维护了一个适当加权的弱学习器(即策略)集成,并训练一个判别器来见证该集成与专家策略之间分布的最大差异。我们维护一个加权回放缓冲区来表示由集成引发的状态-动作分布,使我们能够使用迄今为止收集的所有数据来训练判别器。在加权回放缓冲区中,来自较旧策略的数据贡献被适当地折扣,其权重是基于 boosting 框架计算的。在经验上,我们在 DeepMind Control Suite 的基于控制器状态和基于像素的环境上评估了我们的算法。AILBoost 在两种类型的环境上均优于 DAC,证明了适当加权回放缓冲区数据对离策略训练的益处。在基于状态的环境上,DAC 优于 ValueDICE 和 IQ-Learn (Gary et al., 2021),仅需一条专家轨迹即可实现具有竞争力的性能。

关键词

引用

@article{arxiv.2404.08513,
  title  = {Adversarial Imitation Learning via Boosting},
  author = {Jonathan D. Chang and Dhruv Sreenivas and Yingbing Huang and Kianté Brantley and Wen Sun},
  journal= {arXiv preprint arXiv:2404.08513},
  year   = {2024}
}

备注

19 pages, 7 figures, 4 tables, 3 algorithms, ICLR 2024