中文

面向行为的辅助校正:基于行为感知的离策略时序差量预测

人工智能 2026-05-29 v1

摘要

函数近似下的时序差量学习在离策略抽样情况下可能不稳定。TDC 通过辅助协方差校正来稳定离策略 TD,TDRC 进一步在单时间尺度递归中对该校正进行正则化。本文研究在线性预测设置下,对辅助协方差几何进行行为感知替换,这是理解价值函数逼近特征空间动力学的标准局部模型。我们首先将 TDC 辅助矩阵(C)替换为行为 Bellman 矩阵(A_μ),得到 BA-TDC,然后对相同的行为感知方程进行正则化以得到 BA-TDRC。这种两步构建将行为感知几何的贡献与正则化贡献分离。线性分析还提供了一个用于神经网络价值逼近中辅助几何设计问题的可解析模型,其中特征协方差和时间转移矩阵共同塑造最后一层校正动力学。我们给出有限状态的均值系统形式,证明固定点保持性,并在均值系统满足 Hurwitz 稳定性条件下证明几乎sure收敛,并通过精确线性误差递归的谱半径比较确定性均值收敛速率。实验在两状态反例、Baird 的反例、随机漫步和 Boyan 链上表明,行为感知替换本身在某些任务上具有显著的益处,但正则化对于在更难设置下实现稳健性能是必要的。

关键词

引用

@article{arxiv.2605.28855,
  title  = {Behavior-Aware Auxiliary Corrections for Off-Policy Temporal-Difference Prediction},
  author = {Xingguo Chen and Zhiang He and Yuchen Shen and Shangdong Yang and Chao Li and Guang Yang and Wenhao Wang},
  journal= {arXiv preprint arXiv:2605.28855},
  year   = {2026}
}