中文

关于生成对抗模仿学习的计算与泛化

机器学习 2020-01-14 v2 机器学习

摘要

生成对抗模仿学习(Generative Adversarial Imitation Learning, GAIL)是一种强大且实用的学习序贯决策策略的方法。与强化学习(Reinforcement Learning, RL)不同,GAIL 利用专家(如人类)的示范数据,并学习未知环境的策略与奖励函数。尽管已有显著的实证进展,GAIL 背后的理论仍很大程度上未知。主要困难来自示范数据的底层时间依赖性,以及 GAIL 无凸凹结构的极小极大计算形式。为弥合理论与实践间的鸿沟,本文研究 GAIL 的理论性质。具体而言,我们证明:(1)对于具有一般奖励参数化的 GAIL,只要奖励函数类被适当控制,泛化即可保证;(2)对于奖励参数化为再生核函数的 GAIL,GAIL 可通过随机一阶优化算法高效求解,其以次线性收敛至平稳解。据我们所知,这些是关于带奖励/策略函数近似的模仿学习的统计与计算保证的首批结果。我们提供了数值实验以支持我们的分析。

关键词

引用

@article{arxiv.2001.02792,
  title  = {On Computation and Generalization of Generative Adversarial Imitation Learning},
  author = {Minshuo Chen and Yizhou Wang and Tianyi Liu and Zhuoran Yang and Xingguo Li and Zhaoran Wang and Tuo Zhao},
  journal= {arXiv preprint arXiv:2001.02792},
  year   = {2020}
}