中文

基于梯度目标追踪的深度 Q 学习

机器学习 2025-07-21 v3 系统与控制 系统与控制

摘要

本文引入了 Q 学习中的梯度目标追踪,一种新型强化学习框架,提供一种作为常规硬更新范式的学习型连续目标更新机制。在标准深度 Q 网络(DQN)中,目标网络是在线网络权重的副本,保持固定一段迭代时间后通过硬更新进行周期性替换。虽然这种做法通过提供一致的目标来稳定训练,但引入了新挑战:必须精确调谐硬更新周期以实现最佳性能。为此,我们提出了两种梯度基方法:DQN 采用非对称梯度目标追踪(AGT2-DQN)和 DQN 采用对称梯度目标追踪(SGT2-DQN)。这些方法用梯度下降取代常规的硬目标更新,实现连续且结构化的更新,从而有效消除了人工调谐的需求。我们在表格设置下对这些方法的收敛性进行了理论分析。此外,实证评估表明,它们优于标准 DQN 基准,这表明梯度基于的目标更新可作为 Q 学习中常规目标更新机制的有效替代方案。

关键词

引用

@article{arxiv.2503.16700,
  title  = {Deep Q-Learning with Gradient Target Tracking},
  author = {Bum Geun Park and Taeho Lee and Donghwan Lee},
  journal= {arXiv preprint arXiv:2503.16700},
  year   = {2025}
}