关于具有$\epsilon$-贪婪探索的Deep Q-Networks的收敛性与样本复杂度分析
机器学习
2023-10-26 v1
摘要
本文从理论层面理解深度强化学习中具有-贪婪探索的Deep Q-Network(DQN)。尽管DQN取得了巨大的实证成就,其理论刻画仍鲜有探索。首先,现有分析中的探索策略要么不切实际要么被忽略。其次,与传统Q-learning算法不同,DQN采用目标网络和经验回放来获取训练Q网络所用均方Bellman误差(MSBE)的无偏估计。然而,现有DQN理论分析缺乏收敛性分析,或通过部署显著过参数化的神经网络规避技术挑战,这在计算上并不高效。本文首次给出了具有-贪婪策略的实用DQN设置的收敛性与样本复杂度理论分析。我们证明了带衰减的迭代过程以几何速率收敛到最优Q值函数。此外,较高的值会扩大收敛区域但减慢收敛速度,而较低的值则相反。实验证实了我们所建立的关于DQN的理论见解。
引用
@article{arxiv.2310.16173,
title = {On the Convergence and Sample Complexity Analysis of Deep Q-Networks with $\epsilon$-Greedy Exploration},
author = {Shuai Zhang and Hongkang Li and Meng Wang and Miao Liu and Pin-Yu Chen and Songtao Lu and Sijia Liu and Keerthiram Murugesan and Subhajit Chaudhury},
journal= {arXiv preprint arXiv:2310.16173},
year = {2023}
}