中文

论文重读:熵正则化演员-评论家中的混合策略

机器学习 2026-05-12 v1 人工智能

摘要

混合策略在连续动作强化学习中理论上比单模态策略更具灵活性,但这种复杂性的实际效益仍不明确。大多数最先进算法中缺乏混合策略,这引出一个根本性问题:额外的表示开销是否实用?我们表明,更大的灵活性可以在理论上提升解的质量和熵鲁棒性。然而,像 SAC 这样的标准算法并未利用这些优势。核心问题在于,混合策略缺乏高斯策略所享有的低方差再参数化技巧。我们提出了一种边际化再参数化 (MRP) 估计器来解决这一问题,证明其比标准似然比 (LR) 方法具有更低的方差。我们的实验在 Gym MuJoCo、DeepMind Control Suite 和 MetaWorld 上表明,MRP 混合策略显著优于其 LR 版本,甚至与高斯对手持平或更好。此外,我们确实发现了一些情况下,MRP 混合策略 exhibits 明显的经验优势。本文提供了更清晰的权衡理解,将 MRP 混合策略从理论好奇转变为实用工具。

关键词

引用

@article{arxiv.2605.09157,
  title  = {Revisiting Mixture Policies in Entropy-Regularized Actor-Critic},
  author = {Jiamin He and Samuel Neumann and Jincheng Mei and Adam White and Martha White},
  journal= {arXiv preprint arXiv:2605.09157},
  year   = {2026}
}