中文

DROP:分布式与常规乐观与悲观主义强化学习

机器学习 2026-04-09 v2

摘要

在强化学习(RL)中,时间差(TD)误差已知与多巴胺神经元的放电率相关。观察到每个多巴胺神经元并非一致行为,而是以乐观或悲观方式响应 TD 误差,这被解释为一种分布式 RL 的体现。为解释此生物学数据,已引入带有正负 TD 误差不对称学习率的启发式模型。然而,该启发式模型缺乏理论依据,且未知是否可作为 RL 算法使用。因此,本文引入一种新型理论依据明确的乐观与悲观模型,源自控制即推断(control as inference)。结合集成学习,估计分布式价值函数作为 critic,通过常规引入的乐观与悲观主义。基于其中心值,改进 actor 中的策略。在称 DROP(distributional and regular optimism and pessimism)为此算法后,进行动态任务比较。尽管启发式模型表现不佳,DROP 在所有任务中均展现出优异的通用性,学习性能甚至可与最先进算法相当。换言之,DROP 被认为是一种可发掘乐观与悲观潜在贡献的新模型。

关键词

引用

@article{arxiv.2410.17473,
  title  = {DROP: Distributional and Regular Optimism and Pessimism for Reinforcement Learning},
  author = {Taisuke Kobayashi},
  journal= {arXiv preprint arXiv:2410.17473},
  year   = {2026}
}

备注

51 pages, 15 figures (accepted in Neural Computation)