强化学习中用于离策略价值估计的广义投影 Bellman 误差
机器学习
2024-08-02 v3 人工智能
摘要
许多强化学习算法依赖于价值估计,然而最广泛使用的算法——即时序差分算法——在离策略采样与非线性函数逼近下可能发散。许多基于线性均方投影 Bellman 误差(MSPBE)的离策略价值估计方法已被提出,并在线性函数逼近下是可靠的。将这些方法扩展到非线性情形大体上未获成功。近来,若干方法被引入以近似一个不同的目标——均方 Bellman 误差(MSBE)——其天然便于非线性逼近。在本工作中,我们基于这些见解构建并引入了一种新的广义 MSPBE,将线性 MSPBE 扩展到非线性设定。我们展示了该广义目标如何统一先前工作,并获得了广义目标解的价值误差的新界。我们推导了一种易用且可靠的算法来最小化该广义目标,并表明其在多次运行中更稳定、对超参数更不敏感,且在四个使用神经网络函数逼近的控制域上表现良好。
引用
@article{arxiv.2104.13844,
title = {A Generalized Projected Bellman Error for Off-policy Value Estimation in Reinforcement Learning},
author = {Andrew Patterson and Adam White and Martha White},
journal= {arXiv preprint arXiv:2104.13844},
year = {2024}
}
备注
Accepted for publication in JMLR 2022