中文

不确定性优先经验回放

机器学习 2025-06-12 v1

摘要

优先经验回放通过选择相关转换来更新参数估计,是当代基于价值的深度强化学习模型的关键组成部分。通常,转换的优先级基于其时序差分误差。然而,这种方法容易偏好噪声转换,即使在价值估计接近目标均值时也是如此。这种现象类似于探索文献中提出的噪声电视问题,其中由探索引导的智能体因将噪声误认为新事物而陷入困境。为了减轻噪声在价值估计中的破坏性影响,我们提出使用认知不确定性估计来指导回放缓冲区中转换的优先级选择。认知不确定性量化了可以通过学习减少的不确定性,从而减少从回放缓冲区中采样的、由不可预测的随机过程生成的转换。我们首先在两种表格玩具模型中展示了认知不确定性优先回放的优势:一个简单的多臂赌博机任务和一个噪声网格世界。随后,我们在 Atari 套件上评估了我们的优先级方案,超越了分位数回归深度 Q 学习基准;从而为在强化学习智能体中使用不确定性优先回放铺平了道路。

关键词

引用

@article{arxiv.2506.09270,
  title  = {Uncertainty Prioritized Experience Replay},
  author = {Rodrigo Carrasco-Davis and Sebastian Lee and Claudia Clopath and Will Dabney},
  journal= {arXiv preprint arXiv:2506.09270},
  year   = {2025}
}

备注

Accepted at Reinforcement Learning Conference