C-GAIL:利用控制理论稳定生成对抗模仿学习
机器学习
2024-10-30 v2 系统与控制
系统与控制
摘要
生成对抗模仿学习(GAIL)训练一个生成策略来模仿演示者。它使用在策略强化学习(RL)来优化从类似GAN的判别器导出的奖励信号。GAIL的一个主要缺点是训练不稳定——它继承了GAN的复杂训练动态,以及RL引入的分布偏移。这可能导致训练过程中出现振荡,损害其样本效率和最终策略性能。最近的工作表明,控制理论可以帮助GAN训练的收敛。本文扩展了这一工作,对GAIL进行了控制理论分析,并推导出一种新颖的控制器,不仅将GAIL推向所需的平衡点,而且在“单步”设置中实现了渐近稳定性。基于此,我们提出了一种实用算法“Controlled-GAIL”(C-GAIL)。在MuJoCo任务上,我们的受控变体能够加快收敛速度,减少振荡范围,并更紧密地匹配专家分布,无论是对于原始GAIL还是GAIL-DAC。
引用
@article{arxiv.2402.16349,
title = {C-GAIL: Stabilizing Generative Adversarial Imitation Learning with Control Theory},
author = {Tianjiao Luo and Tim Pearce and Huayu Chen and Jianfei Chen and Jun Zhu},
journal= {arXiv preprint arXiv:2402.16349},
year = {2024}
}