AFU:连续控制中离策略强化学习的无Actor评论家更新
机器学习
2024-10-28 v2 人工智能
摘要
本文提出了AFU,一种离策略深度强化学习算法,以新的方式解决了连续动作空间中Q学习中的具有挑战性的“最大Q问题”,其解决方案基于回归和条件梯度缩放。AFU有一个actor,但其critic更新完全独立于actor。因此,actor可以自由选择。在初始版本AFU-alpha中,我们采用了与Soft Actor-Critic(SAC)相同的随机actor,但随后我们研究了SAC的一个简单失败模式,并展示了如何修改AFU以使actor更新不太可能陷入局部最优,从而产生了算法的第二个版本AFU-beta。实验结果表明,AFU的两个版本都具有样本效率,标志着它是第一个与最先进的actor-critic方法竞争的无模型离策略算法,同时脱离了actor-critic视角。
引用
@article{arxiv.2404.16159,
title = {AFU: Actor-Free critic Updates in off-policy RL for continuous control},
author = {Nicolas Perrin-Gilbert},
journal= {arXiv preprint arXiv:2404.16159},
year = {2024}
}
备注
19 pages, 14 figures