深度双Q学习
机器学习
2026-05-18 v2 人工智能
摘要
双Q学习是一种经典控制算法,用于缓解Q学习的最大化偏差。为此,它显式地训练两个独立的动作价值函数,并在计算引导目标时将它们用于解耦动作选择和动作评估。双DQN 将目标解耦适用于深度强化学习 (RL),但仅显式训练单个动作价值函数,未完全解耦其估算器。因此,两个估算器保持相关性,最大化偏差仍然存在。本文引入深度双Q学习 (DDQL),一种深度RL算法,通过双Q学习显式训练两个Q函数。DDQL通过结合多种技术来稳定训练,包括较低的回放比率、更长的目标网络更新间隔以及共享层。在57个 Atari 2600 游戏上,DDQL在聚合性能上优于双DQN,在47个游戏中取得优异成绩,同时进一步减少最大化偏差。此外,我们研究了将双Q学习适用于深度RL的关键设计选择,包括网络架构、回放比率和小批量采样策略。
引用
@article{arxiv.2507.00275,
title = {Deep Double Q-learning},
author = {Prabhat Nagarajan and Martha White and Marlos C. Machado},
journal= {arXiv preprint arXiv:2507.00275},
year = {2026}
}
备注
44 pages