基于扩散策略的最大熵强化学习
机器学习
2025-06-09 v3 人工智能
摘要
Soft Actor-Critic (SAC) 算法采用高斯策略,已成为实现最大熵强化学习 (MaxEnt RL) 目标的主流实现方法,通过熵最大化鼓励探索并增强策略的鲁棒性。尽管高斯策略在简单任务上表现良好,但其探索能力及其在复杂多目标 RL 环境中的潜在性能,受其内在单模性的限制。在本文中,我们采用扩散模型——一种能够捕捉复杂多模分布的强大生成模型——作为策略表示,以实现 MaxEnt RL 目标,发展出一种称为最大熵扩散策略强化学习 (MaxEntDP) 的方法。我们的 метод 能够高效地进行探索,并使策略更接近最优的 MaxEnt 策略。在 MuJoCo 基准测试中,MaxEntDP 在 MaxEnt RL 框架内超越了高斯策略和其他生成模型,性能与其他领先的基于扩散的在线 RL 算法相当。我们的代码已公开于 https://github.com/diffusionyes/MaxEntDP。
引用
@article{arxiv.2502.11612,
title = {Maximum Entropy Reinforcement Learning with Diffusion Policy},
author = {Xiaoyi Dong and Jian Cheng and Xi Sheryl Zhang},
journal= {arXiv preprint arXiv:2502.11612},
year = {2025}
}
备注
ICML 2025