中文

全梯度后继特征表示

机器学习 2026-04-02 v1

摘要

后继特征(SF)与广义策略改进(GPI)结合,为强化学习(RL)中的迁移学习提供了鲁棒框架,通过将环境动力学与奖励函数解耦。然而,标准 SF 学习方法通常依赖半梯度时序差分(TD)更新。当与非线性函数逼近结合时,半梯度方法缺乏鲁棒的收敛性保证,并可能导致不稳定,特别是在多任务设定中,准确的特征估计对有效的 GPI 至关重要。受 Full Gradient DQN 的启发,我们提出全梯度后继特征表示 Q 学习(FG-SFRQL),一种通过最小化全均方贝尔曼误差来优化后继特征的算法。与标准方法不同,我们的方法同时计算在线网络和目标网络参数上的梯度。我们为 FG-SFRQL 提供了几乎必然收敛的理论证明,并在离散和连续领域中通过实验证明,最小化全残差在样本效率和迁移性能方面均优于半梯度基线方法。

关键词

引用

@article{arxiv.2604.00686,
  title  = {Full-Gradient Successor Feature Representations},
  author = {Ritish Shrirao and Aditya Priyadarshi and Raghuram Bharadwaj Diddigi},
  journal= {arXiv preprint arXiv:2604.00686},
  year   = {2026}
}

备注

Submitted to IEEE CDC 2026