通过后继状态预测提升深Q学习中的Q值更新
机器学习
2025-11-07 v1
摘要
深Q网络(DQN)通过学习从回放缓冲区中采样的转移来估计未来回报。然而,DQN中的目标更新往往依赖于来自过时、可能次优策略生成的下一个状态,导致这些状态可能无法提供信息丰富的学习信号,从而引发更新过程的高方差。当采样的转移与当前策略不够匹配时,这一问题尤为突出。为解决这一局限,我们提出后继状态聚合深度Q网络(SADQ),通过建立随机转移模型显式建模环境动力学。SADQ将后继状态分布整合到Q值估计过程中,从而实现更稳定、与当前策略一致的值更新。此外,它探索了基于所建模转移结构的更高效动作选择策略。我们提供理论保证,表明SADQ在保持无偏值估计的同时可降低训练方差。我们的广泛实证结果在标准RL基准和真实世界向量化控制任务中表明,SADQ在稳定性和学习效率方面均显著优于DQN变体。
引用
@article{arxiv.2511.03836,
title = {Enhancing Q-Value Updates in Deep Q-Learning via Successor-State Prediction},
author = {Lipeng Zu and Hansong Zhou and Xiaonan Zhang},
journal= {arXiv preprint arXiv:2511.03836},
year = {2025}
}