论模仿学习的全局收敛性:以线性二次调节器为例
机器学习
2019-01-15 v1 人工智能
最优化与控制
机器学习
摘要
我们研究了针对线性二次调节器的生成对抗模仿学习的全局收敛性,该问题被表述为极小极大优化。为应对由非凸凹几何结构带来的挑战,我们分析了交替梯度算法,并建立了其以 Q-线性速率收敛到唯一鞍点的性质,该鞍点同时恢复了全局最优策略与奖励函数。我们希望我们的结果能作为一小步,有助于理解并抑制模仿学习以及由强化学习和生成对抗学习所引发的更一般非凸凹交替极小极大优化中的不稳定性。
引用
@article{arxiv.1901.03674,
title = {On the Global Convergence of Imitation Learning: A Case for Linear Quadratic Regulator},
author = {Qi Cai and Mingyi Hong and Yongxin Chen and Zhaoran Wang},
journal= {arXiv preprint arXiv:1901.03674},
year = {2019}
}