中文

Wasserstein 球面 Soft Actor-Critic

机器学习 2026-02-25 v4 系统与控制 系统与控制

摘要

深度基于策略的 actor-critic 算法已成为连续控制领域中强化学习的领先框架。然而,这些算法大多数人在样本效率方面存在问题,尤其是在稀疏奖励的环境中。本文致力于通过提供原则性的有针对性的探索策略来解决此问题。我们提出 Wasserstein 球面 Soft Actor-Critic(WBSAC)算法,该算法受益于用于时序差分学习的悲观 actor 和促进探索的乐观 actor。通过将悲观和乐观策略的 Wasserstein 球面作为探索策略,并调整整个学习过程中的探索程度来实现这一点。我们将 WBSAC 与最先进的基于策略的 actor-critic 算法进行比较,结果表明 WBSAC 在 MuJoCo 连续控制任务上更具样本效率。

关键词

引用

@article{arxiv.2506.10167,
  title  = {Wasserstein Barycenter Soft Actor-Critic},
  author = {Zahra Shahrooei and Ali Baheri},
  journal= {arXiv preprint arXiv:2506.10167},
  year   = {2026}
}