中文

正则化 centered 强调时序差学习

人工智能 2026-05-07 v1

摘要

基于函数近似的 off-policy 时序差(TD)学习面临稳定性、投影几何和方差控制之间的结构性权衡。强调 TD(ETD)通过 follow-on emphasis 改善了 off-policy 投影几何,但 follow-on trace 可能具有较高方差。我们通过 Bellman 误差 centered 来重新审视这一权衡。虽然 centered 本然会消除 TD 误差中的常见漂移项,但我们发现,简单的 centered 扩展引入的辅助耦合会破坏 ETD key 矩阵的正定性。我们提出了正则化强调时序差学习(RETD),该方法保留 follow-on trace 并仅对辅助 centered 递推进行正则化,对应于将耦合 key 矩阵的下右块从 11 提升到 1+c1+c。我们推导了 RETD core 矩阵,证明了在保守的充分正则化条件下进行收敛,并在诊断线性 off-policy 预测任务上进行评估。实验表明,RETD 避免了简单 centered 学习的不稳定性,保留了有利的强调几何,并在诊断任务中对正则化参数 cc 表现出稳健的中间 regime。

关键词

引用

@article{arxiv.2605.04100,
  title  = {Regularized Centered Emphatic Temporal Difference Learning},
  author = {Xingguo Chen and Chaohui Wu and Jinguo Ye and Chao Li and Shangdong Yang and Guang Yang and Tianyu Liang and Wenhao Wang},
  journal= {arXiv preprint arXiv:2605.04100},
  year   = {2026}
}