扩散Actor-Critic: 将受限策略迭代形式化为离线强化学习中的扩散噪声回归
机器学习
2025-02-26 v3
摘要
在离线强化学习中,需要管理超分布动作以防止价值函数的高估。一类方法即策略正则化方法,通过约束目标策略保持接近行为策略来解决此问题。虽然有多个方法建议将行为策略表示为表达力更强的扩散模型以提升性能,但如何给定扩散模型行为采样器对目标策略进行正则化仍不明确。本文提出了扩散Actor-Critic (DAC),将克尔默-莱布尔 (KL) 约束策略迭代形式化为扩散噪声回归问题,实现对目标策略直接表示为扩散模型。我们的方法遵循Actor-Critic学习范式,交替训练以扩散模型为目标策略和批评网络。Actor训练损失包括来自Q梯度的软Q引导项。软Q引导基于KL约束策略迭代的理论解,防止学习的策略采取超分布动作。我们展示了这种基于扩散的策略约束,结合对Q-集团的下置置信界作为价值目标,不仅保留了目标策略的多模态性,也有助于DAC的稳定收敛和卓越性能。在D4RL基准测试中,我们的方法在几乎所有环境中均优于最新技术。代码已公开于 https://github.com/Fang-Lin93/DAC。
引用
@article{arxiv.2405.20555,
title = {Diffusion Actor-Critic: Formulating Constrained Policy Iteration as Diffusion Noise Regression for Offline Reinforcement Learning},
author = {Linjiajie Fang and Ruoxue Liu and Jing Zhang and Wenjia Wang and Bing-Yi Jing},
journal= {arXiv preprint arXiv:2405.20555},
year = {2025}
}