中文

深度Q网络的通用逼近定理

机器学习 2025-05-06 v1 人工智能 机器学习

摘要

我们通过随机控制和正倒向随机微分方程(FBSDE)建立了一个用于分析深度Q网络(DQN)的连续时间框架。考虑一个由平方可积鞅驱动的连续时间马尔可夫决策过程(MDP),我们分析了DQN的逼近性质。我们利用残差网络逼近定理和状态-动作过程的大偏差界,证明了DQN能够在紧集上以任意精度和高概率逼近最优Q函数。然后,我们分析了在此设定下训练DQN的通用Q学习算法的收敛性,并采用了随机逼近定理。我们的分析强调了DQN层数、时间离散化以及粘性解(主要针对值函数VV^*)在处理最优Q函数潜在非光滑性中的作用。这项工作连接了深度强化学习和随机控制,为连续时间设定下的DQN提供了见解,这对于涉及物理系统或高频数据的应用具有相关性。

关键词

引用

@article{arxiv.2505.02288,
  title  = {Universal Approximation Theorem of Deep Q-Networks},
  author = {Qian Qi},
  journal= {arXiv preprint arXiv:2505.02288},
  year   = {2025}
}