中文

基于神经网络的生成对抗模仿学习:全局最优性与收敛速率

机器学习 2020-06-26 v2 最优化与控制 机器学习

摘要

生成对抗模仿学习(GAIL)在实践中取得了巨大成功,尤其在与神经网络结合时。与强化学习不同,GAIL 从专家(人类)示范中学习策略和奖励函数。尽管其实证成功,目前仍不清楚带神经网络的 GAIL 是否收敛到全局最优解。主要困难来自非凸-非凹极小极大优化结构。为弥合实践与理论间的差距,我们分析了一种交替更新的基于梯度的算法,并建立了其到全局最优解的次线性收敛。据我们所知,我们的分析首次建立了带神经网络的 GAIL 的全局最优性与收敛速率。

关键词

引用

@article{arxiv.2003.03709,
  title  = {Generative Adversarial Imitation Learning with Neural Networks: Global Optimality and Convergence Rate},
  author = {Yufeng Zhang and Qi Cai and Zhuoran Yang and Zhaoran Wang},
  journal= {arXiv preprint arXiv:2003.03709},
  year   = {2020}
}

备注

42 pages; accepted to ICML; initial draft submitted in Feb, 2020