Q 学习中目标更新频率的作用
机器学习
2026-02-05 v1 最优化与控制
机器学习
摘要
目标网络更新频率(TUF)是深度 Q 学习中的核心稳定机制,但其选择仍不被充分理解,常被当作仅供调谐的超参数而非原则性决策。本工作通过近似动态编程的视角,对表格 Q 学习中的目标固定进行理论分析。我们将周期性目标更新表述为嵌套优化方案,其中每一次外层迭代通过一个通用的内层优化器近似求解的 Bellman 最优算子。严格的理论结果为异步抽样情境下的有限时间收敛分析,特别是针对内层的随机梯度下降。我们的结果对目标更新周期引发的偏差-方差权衡进行了明确刻画,揭示了如何最佳设置此关键超参数。我们证明,常数目标更新计划次优,会引入可被自适应计划完全避免的对样本复杂度的对数开销。我们的分析表明,最佳目标更新频率会随学习过程几何递增。
引用
@article{arxiv.2602.03911,
title = {The Role of Target Update Frequencies in Q-Learning},
author = {Simon Weissmann and Tilman Aach and Benedikt Wille and Sebastian Kassing and Leif Döring},
journal= {arXiv preprint arXiv:2602.03911},
year = {2026}
}