中文

S$^2$AC: 基于 Stein Soft Actor Critic 的能量强化学习

机器学习 2024-05-03 v1

摘要

学习具有表达能力的随机策略而非确定性策略,已被提出用于实现更好的稳定性、样本复杂度和鲁棒性。值得注意的是,在最大熵强化学习(Maximum Entropy Reinforcement Learning, MaxEnt RL)中,策略被建模为基于 Q 值的具有表达能力的能量模型(Energy-Based Model, EBM)。然而,这种表述需要估计此类 EBM 的熵,这是一个悬而未决的问题。为了解决这一问题,以往的 MaxEnt RL 方法要么隐式估计熵,导致高计算复杂度和方差(SQL);要么遵循变分推断流程,为便于处理而拟合简化的 actor 分布(如高斯分布)(SAC)。我们提出了 Stein Soft Actor-Critic(S2^2AC),一种在不牺牲效率的前提下学习具有表达能力策略的 MaxEnt RL 算法。具体而言,S2^2AC 使用参数化的 Stein 变分梯度下降(Stein Variational Gradient Descent, SVGD)作为底层策略。我们推导了此类策略熵的闭式表达式。我们的公式计算高效,仅依赖于一阶导数和向量乘积。实证结果表明,在多目标环境中,S2^2AC 相比 SQL 和 SAC 能够为 MaxEnt 目标提供更优的解,并在 MuJoCo 基准测试中优于 SAC 和 SQL。代码可在 https://github.com/SafaMessaoud/S2AC-Energy-Based-RL-with-Stein-Soft-Actor-Critic 获取。

关键词

引用

@article{arxiv.2405.00987,
  title  = {S$^2$AC: Energy-Based Reinforcement Learning with Stein Soft Actor Critic},
  author = {Safa Messaoud and Billel Mokeddem and Zhenghai Xue and Linsey Pang and Bo An and Haipeng Chen and Sanjay Chawla},
  journal= {arXiv preprint arXiv:2405.00987},
  year   = {2024}
}

备注

Accepted for publication at ICLR 2024