基于神经网络的生成对抗模仿学习:全局最优性与收敛速率
机器学习
2020-06-26 v2 最优化与控制
机器学习
摘要
生成对抗模仿学习(GAIL)在实践中取得了巨大成功,尤其在与神经网络结合时。与强化学习不同,GAIL 从专家(人类)示范中学习策略和奖励函数。尽管其实证成功,目前仍不清楚带神经网络的 GAIL 是否收敛到全局最优解。主要困难来自非凸-非凹极小极大优化结构。为弥合实践与理论间的差距,我们分析了一种交替更新的基于梯度的算法,并建立了其到全局最优解的次线性收敛。据我们所知,我们的分析首次建立了带神经网络的 GAIL 的全局最优性与收敛速率。
引用
@article{arxiv.2003.03709,
title = {Generative Adversarial Imitation Learning with Neural Networks: Global Optimality and Convergence Rate},
author = {Yufeng Zhang and Qi Cai and Zhuoran Yang and Zhaoran Wang},
journal= {arXiv preprint arXiv:2003.03709},
year = {2020}
}
备注
42 pages; accepted to ICML; initial draft submitted in Feb, 2020