中文

DiffAIL:扩散对抗模仿学习

机器学习 2023-12-13 v2

摘要

模仿学习旨在解决现实世界决策任务中奖励函数定义的问题。当前流行的方法是生成对抗模仿学习(AIL)框架,该框架通过匹配专家状态-动作占用度量来获得用于前向强化学习的替代奖励。然而,传统的判别器是一个简单的二分类器,无法学习到准确的分布,这可能导致其无法识别由与环境交互的策略所产生的专家级状态-动作对。为了解决这个问题,我们提出了一种名为扩散对抗模仿学习(DiffAIL)的方法,该方法将扩散模型引入到AIL框架中。具体而言,DiffAIL将状态-动作对建模为无条件扩散模型,并使用扩散损失作为判别器学习目标的一部分,这使得判别器能够更好地捕获专家演示并提高泛化能力。实验结果表明,我们的方法在两个基准任务上达到了最先进的性能,并显著超越了专家演示,包括标准的状态-动作设置和仅状态设置。我们的代码可在链接https://github.com/ML-Group-SDU/DiffAIL获取。

关键词

引用

@article{arxiv.2312.06348,
  title  = {DiffAIL: Diffusion Adversarial Imitation Learning},
  author = {Bingzheng Wang and Guoqiang Wu and Teng Pang and Yan Zhang and Yilong Yin},
  journal= {arXiv preprint arXiv:2312.06348},
  year   = {2023}
}

备注

Accepted at AAAI 2024