Wasserstein 球面 Soft Actor-Critic
机器学习
2026-02-25 v4 系统与控制
系统与控制
摘要
深度基于策略的 actor-critic 算法已成为连续控制领域中强化学习的领先框架。然而,这些算法大多数人在样本效率方面存在问题,尤其是在稀疏奖励的环境中。本文致力于通过提供原则性的有针对性的探索策略来解决此问题。我们提出 Wasserstein 球面 Soft Actor-Critic(WBSAC)算法,该算法受益于用于时序差分学习的悲观 actor 和促进探索的乐观 actor。通过将悲观和乐观策略的 Wasserstein 球面作为探索策略,并调整整个学习过程中的探索程度来实现这一点。我们将 WBSAC 与最先进的基于策略的 actor-critic 算法进行比较,结果表明 WBSAC 在 MuJoCo 连续控制任务上更具样本效率。
引用
@article{arxiv.2506.10167,
title = {Wasserstein Barycenter Soft Actor-Critic},
author = {Zahra Shahrooei and Ali Baheri},
journal= {arXiv preprint arXiv:2506.10167},
year = {2026}
}