中文

深度 Q 学习的理论分析

机器学习 2020-02-25 v3 最优化与控制 机器学习

摘要

尽管深度强化学习取得了巨大的经验成功,其理论基础却较少被理解。本文中,我们首次尝试从算法与统计两个视角对深度 Q 网络(DQN)算法(Mnih 等人,2015)进行理论理解。具体而言,我们关注 DQN 的一个略微简化版本,其充分捕捉了关键特征。在温和假设下,我们建立了 DQN 所得迭代策略序列的动作值函数的算法与统计收敛速率。特别地,统计误差刻画了使用深度神经网络逼近动作值函数所产生的偏差与方差,而算法误差以几何速率收敛到零。作为副产品,我们的分析为经验回放和目标网络技术提供了依据,这些技术对 DQN 的经验成功至关重要。此外,作为 DQN 的简单扩展,我们提出了用于双人零和 Markov 博弈的 Minimax-DQN 算法。借鉴 DQN 的分析,我们还量化了 Minimax-DQN 所得策略与 Markov 博弈纳什均衡之间在算法与统计收敛速率上的差异。

关键词

引用

@article{arxiv.1901.00137,
  title  = {A Theoretical Analysis of Deep Q-Learning},
  author = {Jianqing Fan and Zhaoran Wang and Yuchen Xie and Zhuoran Yang},
  journal= {arXiv preprint arXiv:1901.00137},
  year   = {2020}
}

备注

65 pages