中文

生成对抗模仿学习算法何时达到全局收敛

机器学习 2020-06-26 v2 机器学习

摘要

生成对抗模仿学习(GAIL)是一种流行的逆强化学习方法,用于从专家轨迹联合优化策略与奖励。关于 GAIL 的一个核心问题是:对 GAIL 应用某一策略梯度算法是否能达到全局极小化器(即产生专家策略),现有理解非常有限。这种全局收敛仅在线性(或线性型)MDP 与线性(或可线性化)奖励下被证明。本文中,我们在一般 MDP 下并针对非线性奖励函数类(只要目标函数关于奖励参数强凹)研究 GAIL。我们刻画了广泛使用的各类常见策略梯度算法以次线性速率达到全局收敛的性质,这些算法均以与随机梯度上升进行奖励更新的交替方式实现,包括投影策略梯度(PPG)-GAIL、Frank-Wolfe 策略梯度(FWPG)-GAIL、信赖域策略优化(TRPO)-GAIL 与自然策略梯度(NPG)-GAIL。这是首个关于 GAIL 全局收敛的系统性理论研究。

关键词

引用

@article{arxiv.2006.13506,
  title  = {When Will Generative Adversarial Imitation Learning Algorithms Attain Global Convergence},
  author = {Ziwei Guan and Tengyu Xu and Yingbin Liang},
  journal= {arXiv preprint arXiv:2006.13506},
  year   = {2020}
}

备注

Submitted for publication