扩散奖励对抗性模仿学习
机器学习
2024-11-27 v4 人工智能
机器人学
摘要
模仿学习旨在通过观察专家演示来学习策略,而无需环境中的奖励信号。生成式对抗性模仿学习(GAIL)将模仿学习形式化为对抗学习,采用生成器策略学习以模仿专家行为,同时学习判别器以区分专家演示与智能体轨迹。尽管GAIL取得了鼓舞人心的效果,但其训练常常脆弱且不稳定。灵感来自扩散模型在生成式建模中的主导地位,我们提出了扩散奖励对抗性模仿学习(DRAIL),将扩散模型集成到GAIL中,以实现更稳健、更平滑的奖励用于策略学习。具体而言,我们提出了扩散判别式分类器以构建增强判别器,并设计基于分类器输出的扩散奖励用于策略学习。在导航、操控和运动等任务上进行大量实验,验证了DRAIL相对于先前模仿学习方法的有效性。此外,额外的实验结果表明DRAIL具有良好的可泛化性和数据效率。可视化的GAIL和DRAIL所学习的奖励函数表明,DRAIL能够产生更稳健、更平滑的奖励。项目页面:https://nturobotlearninglab.github.io/DRAIL/
引用
@article{arxiv.2405.16194,
title = {Diffusion-Reward Adversarial Imitation Learning},
author = {Chun-Mao Lai and Hsiang-Chun Wang and Ping-Chun Hsieh and Yu-Chiang Frank Wang and Min-Hung Chen and Shao-Hua Sun},
journal= {arXiv preprint arXiv:2405.16194},
year = {2024}
}
备注
NeurIPS 2024. Project page: https://nturobotlearninglab.github.io/DRAIL/