暂停智能体回放刷新
机器学习
2022-09-28 v1
摘要
自目标网络发明以来,强化学习算法变得更加复杂。遗憾的是,目标网络未能跟上这种复杂性的增长,反而需要近似解才能在计算上可行。这些近似增加了 Q 值目标和回放采样分布中的噪声。暂停智能体回放刷新(PARR)是目标网络的一种即插即用替代方案,它支持更复杂的 learning 算法而无需此类近似。使用基础 Q 网络架构,并刷新新颖性值、目标值和回放采样分布,PARR 在仅 30.9 百万 Atari 帧后于 Montezuma's Revenge 中获得 2500 分。最后,在基于碳的学习背景下解释 PARR,为睡眠提供了新理由。
引用
@article{arxiv.2209.13398,
title = {Paused Agent Replay Refresh},
author = {Benjamin Parr},
journal= {arXiv preprint arXiv:2209.13398},
year = {2022}
}