DQN 真的能学习吗?
机器学习
2025-06-18 v5 最优化与控制
摘要
任何强化学习方法的一个基本要求是,它应当产生比初始猜测有所改进的策略。在这项工作中,我们表明广泛使用的深度 Q 网络(DQN)未能满足这一最低标准——即使它能够无限次地看到所有可能的状态和动作(在这一条件下,表格 Q-learning 保证收敛到最优 Q 值函数)。我们的具体贡献有两点。首先,我们通过数值实验表明 DQN 经常返回一个比初始策略更差的策略。其次,我们为这一现象在线性 DQN 中提供了理论解释;线性 DQN 是 DQN 的简化版本,使用线性函数逼近代替神经网络,同时保留其他关键组件,如 -贪婪探索、经验回放和目标网络。利用微分包含理论中的工具,我们证明线性 DQN 的极限点对应于投影 Bellman 算子的不动点。关键在于,我们表明这些不动点未必与最优——甚至近似最优——策略相关,从而解释了线性 DQN 的次优行为。我们还给出了一个线性 DQN 总是识别出最差策略的场景。我们的工作填补了在理解带函数逼近和 -贪婪探索的 Q-learning 收敛行为方面长期存在的空白。
引用
@article{arxiv.2205.13617,
title = {Does DQN Learn?},
author = {Aditya Gopalan and Gugan Thoppe},
journal= {arXiv preprint arXiv:2205.13617},
year = {2025}
}
备注
24 pages, 3 figures