中文

悲观 Actor-Critic 中验证缓冲区的案例

机器学习 2024-03-05 v1

摘要

在本文中,我们研究了通过悲观时序差分目标更新的 critic 网络中的误差累积问题。我们表明,critic 近似误差可以通过类似于 Bellman 值的递归不动点模型来近似。我们使用这种递归定义来检索悲观 critic 无偏的条件。基于这些见解,我们提出了验证悲观学习 (VPL) 算法。VPL 使用一个小型验证缓冲区来调整整个智能体训练过程中的悲观水平,并将悲观度设置为使 critic 目标的近似误差最小化。我们在各种运动和操作任务上研究了所提出的方法,并报告了样本效率和性能的改进。

关键词

引用

@article{arxiv.2403.01014,
  title  = {A Case for Validation Buffer in Pessimistic Actor-Critic},
  author = {Michal Nauman and Mateusz Ostaszewski and Marek Cygan},
  journal= {arXiv preprint arXiv:2403.01014},
  year   = {2024}
}

备注

Preprint