中文

基于扩散策略的最大熵强化学习

机器学习 2025-06-09 v3 人工智能

摘要

Soft Actor-Critic (SAC) 算法采用高斯策略,已成为实现最大熵强化学习 (MaxEnt RL) 目标的主流实现方法,通过熵最大化鼓励探索并增强策略的鲁棒性。尽管高斯策略在简单任务上表现良好,但其探索能力及其在复杂多目标 RL 环境中的潜在性能,受其内在单模性的限制。在本文中,我们采用扩散模型——一种能够捕捉复杂多模分布的强大生成模型——作为策略表示,以实现 MaxEnt RL 目标,发展出一种称为最大熵扩散策略强化学习 (MaxEntDP) 的方法。我们的 метод 能够高效地进行探索,并使策略更接近最优的 MaxEnt 策略。在 MuJoCo 基准测试中,MaxEntDP 在 MaxEnt RL 框架内超越了高斯策略和其他生成模型,性能与其他领先的基于扩散的在线 RL 算法相当。我们的代码已公开于 https://github.com/diffusionyes/MaxEntDP。

关键词

引用

@article{arxiv.2502.11612,
  title  = {Maximum Entropy Reinforcement Learning with Diffusion Policy},
  author = {Xiaoyi Dong and Jian Cheng and Xi Sheryl Zhang},
  journal= {arXiv preprint arXiv:2502.11612},
  year   = {2025}
}

备注

ICML 2025