面向离线强化学习的带 Q 集成的熵正则化扩散策略
机器学习
2025-01-09 v3 系统与控制
系统与控制
摘要
本文提出了训练扩散策略以用于离线强化学习(RL)的先进技术。其核心是一个均值回归随机微分方程(SDE),该方程将复杂的动作分布转换为标准高斯分布,然后利用相应的反向时间 SDE 根据环境状态采样动作,如同典型的扩散策略一样。我们证明这样的 SDE 存在一个解,我们可以利用它计算策略的对数概率,从而产生一个能改进离线数据集探索的熵正则化项。为了减轻分布外数据点导致的不准确值函数的影响,我们进一步提出学习 Q 集成的下置信界,以实现更稳健的策略改进。通过在离线 RL 中将熵正则化扩散策略与 Q 集成相结合,我们的方法在 D4RL 基准测试的大多数任务上取得了 SOTA 性能。代码可在 https://github.com/ruoqizzz/Entropy-Regularized-Diffusion-Policy-with-QEnsemble 获取。
引用
@article{arxiv.2402.04080,
title = {Entropy-regularized Diffusion Policy with Q-Ensembles for Offline Reinforcement Learning},
author = {Ruoqi Zhang and Ziwei Luo and Jens Sjölund and Thomas B. Schön and Per Mattsson},
journal= {arXiv preprint arXiv:2402.04080},
year = {2025}
}