探索生成对抗模仿学习中的梯度爆炸:一种概率视角
机器学习
2023-12-19 v1 人工智能
摘要
生成对抗模仿学习(GAIL)是模仿学习中的一种基石方法。本文研究了两种GAIL中的梯度爆炸问题:确定性策略GAIL(DE-GAIL)和随机策略GAIL(ST-GAIL)。我们首先观察到,DE-GAIL在训练阶段初期可能高度不稳定并最终发散。相反,ST-GAIL的训练轨迹保持一致,可靠地收敛。为了阐明这些差异,我们从理论角度提供了解释。通过为GAIL建立概率下界,我们证明了梯度爆炸是DE-GAIL的必然结果,原因是专家与模仿者策略之间偶尔存在较大差异,而ST-GAIL则不存在此问题。为证实我们的论断,我们说明了奖励函数的修改如何缓解梯度爆炸挑战。最后,我们提出了CREDO,一种简单而有效的策略,在训练阶段裁剪奖励函数,使GAIL能够享受高数据效率和稳定的可训练性。
引用
@article{arxiv.2312.11214,
title = {Exploring Gradient Explosion in Generative Adversarial Imitation Learning: A Probabilistic Perspective},
author = {Wanying Wang and Yichen Zhu and Yirui Zhou and Chaomin Shen and Jian Tang and Zhiyuan Xu and Yaxin Peng and Yangchun Zhang},
journal= {arXiv preprint arXiv:2312.11214},
year = {2023}
}
备注
AAAI2024