GB-DQN:用于非平稳强化学习的梯度提升DQN模型
机器学习
2025-12-22 v1
摘要
非平稳环境是深度强化学习面临的根本性挑战,因为动态或奖励的变化会使已学习的价值函数失效,导致灾难性遗忘。我们提出了梯度提升深度Q网络(GB-DQN),这是一种通过增量残差学习来解决模型漂移的自适应集成方法。与重新训练单个Q网络不同,GB-DQN构建一种加法式集成,其中每个新的学习者都被训练来逼近当前集成在漂移后的贝尔曼残差。我们提供了理论结果,表明每个提升步骤都减少经验贝尔曼残差,且该集成在标准假设下会收敛到漂移后的最优价值函数。跨一组具有受控动态变化的控制任务的实验表明,GB-DQN在恢复速度、稳定性和鲁棒性方面均优于DQN和常见的非平稳基线方法。
引用
@article{arxiv.2512.17034,
title = {GB-DQN: Gradient Boosted DQN Models for Non-stationary Reinforcement Learning},
author = {Chang-Hwan Lee and Chanseung Lee},
journal= {arXiv preprint arXiv:2512.17034},
year = {2025}
}
备注
23 pages. Submitted to Machine Learning