基于行为诱导的镜像-Prox 时序差学习以加速离策略预测
人工智能
2026-05-29 v1
摘要
梯度时序差方法在线性函数逼近下提供稳定的离策略预测,但其实际性能严重受由辅助变量度量诱导的几何的影响。现有的镜像-Prox 时序差方法通常使用特征协方差度量,而混合 TD 方法则暗示行为策略转换信息可以提供更有信息的更新几何。本文提出一种称为 STHTD-MP 的行为诱导镜像-Prox 时序差方法,用行为策略 Bellman 矩阵的对称部分取代原始-对偶鞍点公式中的协方差度量。该方法保持原始变量和辅助变量的单一学习率,并对结果混合鞍点算子应用镜像-Prox 预测-纠正步骤。我们在标准随机逼近假设下对固定策略线性预测进行形式收敛分析:行为诱导的度量是正定的,联合均值系统是 Hurwitz 的,界限性来自李apunov 论证,随机递归通过 ODE 方法收敛。我们进一步推导投影型-oracle ergodic间隙界限以及基于确定性镜像-Prox误差矩阵谱半径的精确均值算子与 GTD2-MP 的比较。分析表明,当行为诱导的度量改善鞍点几何时,STHTD-MP 可以比 GTD2-MP 拥有更小的均值收缩因子。两个状态、随机漫步和 Boyan 链的精确数值均值算子分析支持这一条件,而 Baird 的反例被确定为严格假设失败的奇异边界情况。
引用
@article{arxiv.2605.28849,
title = {Behavior-Induced Mirror-Prox Temporal-Difference Learning for Faster Off-Policy Prediction},
author = {Xingguo Chen and Yuchen Shen and Shangdong Yang and Chao Li and Guang Yang and Wenhao Wang},
journal= {arXiv preprint arXiv:2605.28849},
year = {2026}
}