具有高扩散效率的增强 DACER 算法
机器学习
2025-10-03 v2 人工智能
摘要
由于其强大的表达能力,扩散模型在离线强化学习和模仿学习中展现出了巨大潜力。带熵调节器的扩散演员-评论家算法 (Diffusion Actor-Critic with Entropy Regulator, DACER) 通过将逆向扩散过程用作策略近似器,将此能力扩展至在线强化学习,实现了最先进的性能。然而,它仍面临一个核心权衡:更多的扩散步骤能确保高性能但会降低效率,而更少的步骤则会损害性能。这仍然是在实时在线强化学习中部署扩散策略的主要瓶颈。为了缓解这一问题,我们提出了 DACERv2,它利用关于动作的 Q 梯度场目标作为辅助优化目标,在每个扩散步骤中引导去噪过程,从而引入中间监督信号以提高单步扩散的效率。此外,我们观察到 Q 梯度场对扩散时间步的独立性与扩散过程的特性不一致。为了解决这个问题,引入了时间加权机制,使模型能够在早期阶段有效消除大规模噪声,并在后期阶段细化其输出。在 OpenAI Gym 基准和多模态任务上的实验结果表明,与经典的及基于扩散的在线强化学习算法相比,DACERv2 仅用五个扩散步骤便在大多数复杂控制环境中取得了更高的性能,并展现出更强的多模态性。
引用
@article{arxiv.2505.23426,
title = {Enhanced DACER Algorithm with High Diffusion Efficiency},
author = {Yinuo Wang and Likun Wang and Mining Tan and Wenjun Zou and Xujie Song and Wenxuan Wang and Tong Liu and Guojian Zhan and Tianze Zhu and Shiqi Liu and Zeyu He and Feihong Zhang and Jingliang Duan and Shengbo Eben Li},
journal= {arXiv preprint arXiv:2505.23426},
year = {2025}
}