中文

强化学习中用于离策略价值估计的广义投影 Bellman 误差

机器学习 2024-08-02 v3 人工智能

摘要

许多强化学习算法依赖于价值估计,然而最广泛使用的算法——即时序差分算法——在离策略采样与非线性函数逼近下可能发散。许多基于线性均方投影 Bellman 误差(MSPBE)的离策略价值估计方法已被提出,并在线性函数逼近下是可靠的。将这些方法扩展到非线性情形大体上未获成功。近来,若干方法被引入以近似一个不同的目标——均方 Bellman 误差(MSBE)——其天然便于非线性逼近。在本工作中,我们基于这些见解构建并引入了一种新的广义 MSPBE,将线性 MSPBE 扩展到非线性设定。我们展示了该广义目标如何统一先前工作,并获得了广义目标解的价值误差的新界。我们推导了一种易用且可靠的算法来最小化该广义目标,并表明其在多次运行中更稳定、对超参数更不敏感,且在四个使用神经网络函数逼近的控制域上表现良好。

关键词

引用

@article{arxiv.2104.13844,
  title  = {A Generalized Projected Bellman Error for Off-policy Value Estimation in Reinforcement Learning},
  author = {Andrew Patterson and Adam White and Martha White},
  journal= {arXiv preprint arXiv:2104.13844},
  year   = {2024}
}

备注

Accepted for publication in JMLR 2022