中文

关于具有$\epsilon$-贪婪探索的Deep Q-Networks的收敛性与样本复杂度分析

机器学习 2023-10-26 v1

摘要

本文从理论层面理解深度强化学习中具有ε\varepsilon-贪婪探索的Deep Q-Network(DQN)。尽管DQN取得了巨大的实证成就,其理论刻画仍鲜有探索。首先,现有分析中的探索策略要么不切实际要么被忽略。其次,与传统Q-learning算法不同,DQN采用目标网络和经验回放来获取训练Q网络所用均方Bellman误差(MSBE)的无偏估计。然而,现有DQN理论分析缺乏收敛性分析,或通过部署显著过参数化的神经网络规避技术挑战,这在计算上并不高效。本文首次给出了具有ϵ\epsilon-贪婪策略的实用DQN设置的收敛性与样本复杂度理论分析。我们证明了带衰减ϵ\epsilon的迭代过程以几何速率收敛到最优Q值函数。此外,较高的ϵ\epsilon值会扩大收敛区域但减慢收敛速度,而较低的ϵ\epsilon值则相反。实验证实了我们所建立的关于DQN的理论见解。

关键词

引用

@article{arxiv.2310.16173,
  title  = {On the Convergence and Sample Complexity Analysis of Deep Q-Networks with $\epsilon$-Greedy Exploration},
  author = {Shuai Zhang and Hongkang Li and Meng Wang and Miao Liu and Pin-Yu Chen and Songtao Lu and Sijia Liu and Keerthiram Murugesan and Subhajit Chaudhury},
  journal= {arXiv preprint arXiv:2310.16173},
  year   = {2023}
}