重新审视离策略强化学习中的高斯混合评论家:一种基于样本的方法
机器学习
2022-04-25 v2 人工智能
摘要
使用分布式子策略评估的 actor-critic 算法在许多具有挑战性的控制任务上频繁被证明优于非分布式的对应算法。这种行为包括 D4PG 和 DMPO 算法相对于 DDPG 和 MPO respectively [Barth-Maron et al., 2018; Hoffman et al., 2020]。然而,两种智能体都依赖 C51 评论家进行价值估计。C51 方法的一个主要缺陷是需要关于策略所能达到的最小和最大值的先验知识以及所用的 bin 数量,这固定了分布估计的分辨率。虽然 DeepMind 控制套件任务使用标准化奖励和回合长度,从而使得整个套件可用这些超参数的单一设置求解,但情况往往并非如此。本文重新审视一种消除此要求的自然替代方案,即高斯混合,以及一种在离策略机制中训练它的简单基于样本的损失函数。我们在广泛的连续控制任务上对其性能进行了经验评估,并证明它消除了对这些分布超参数的需求,并在多种挑战性任务(例如 humanoid、dog、quadruped 和 manipulator 域)上实现了 SOTA 性能。最后我们在 Acme 智能体仓库中提供了实现。
引用
@article{arxiv.2204.10256,
title = {Revisiting Gaussian mixture critics in off-policy reinforcement learning: a sample-based approach},
author = {Bobak Shahriari and Abbas Abdolmaleki and Arunkumar Byravan and Abe Friesen and Siqi Liu and Jost Tobias Springenberg and Nicolas Heess and Matt Hoffman and Martin Riedmiller},
journal= {arXiv preprint arXiv:2204.10256},
year = {2022}
}