目标网络与过参数化稳定基于函数逼近的离策略自举
机器学习
2025-10-21 v3 人工智能
摘要
我们证明,在某些情况下,即使使用离策略数据,目标网络与过参数化线性函数逼近的组合也为自举值估计建立了更弱的收敛条件。我们的条件自然满足于对整个状态-动作空间的期望更新,或使用来自情节马尔可夫决策过程的完整轨迹批次进行学习。值得注意的是,仅使用目标网络或过参数化模型并不能提供这样的收敛保证。此外,我们将结果扩展到截断轨迹的学习,表明通过微小修改(类似于对轨迹中最终状态的值截断),所有任务均可实现收敛。我们的主要结果集中于预测的时序差分估计,提供了高概率的值估计误差界,并在Baird反例和四房间任务上进行了实证分析。此外,我们探讨了控制设置,表明类似的收敛条件适用于Q学习。
引用
@article{arxiv.2405.21043,
title = {Target Networks and Over-parameterization Stabilize Off-policy Bootstrapping with Function Approximation},
author = {Fengdi Che and Chenjun Xiao and Jincheng Mei and Bo Dai and Ramki Gummadi and Oscar A Ramirez and Christopher K Harris and A. Rupam Mahmood and Dale Schuurmans},
journal= {arXiv preprint arXiv:2405.21043},
year = {2025}
}