基于扩散策略的分布式软演员-专家算法
机器学习
2025-07-14 v3 人工智能
摘要
强化学习已被证明在处理复杂控制任务方面非常有效。传统方法通常使用单模分布(如高斯分布)来建模价值分布的输出。然而,单模分布常常容易导致价值函数估计偏差,从而导致算法性能差。本文提出了一种称为DSAC-D(分布式软演员-专家带扩散策略)的分布式强化学习算法,以解决价值函数估计偏差和获取多模策略表示的问题。通过引入策略熵和价值分布函数,建立了可以收敛于最优策略的多模分布式策略迭代框架。通过使用扩散模型进行逆采样生成一组奖励样本,构建了能够准确刻画多峰分布的扩散价值网络。基于此,推导出价值网络和策略网络双重扩散的分布式强化学习算法。MuJoCo测试任务表明,所提出的算法不仅学习多模策略,而且在所有9个控制任务中实现了状态-of-the-art(SOTA)性能,在估计偏差方面显著抑制,并相对于现有主流算法实现了超过10%的总平均回报提升。真实车辆测试结果表明,DSAC-D能够准确刻画不同驾驶风格的多模分布,扩散策略网络能够刻画多模轨迹。
引用
@article{arxiv.2507.01381,
title = {Distributional Soft Actor-Critic with Diffusion Policy},
author = {Tong Liu and Yinuo Wang and Xujie Song and Wenjun Zou and Liangfa Chen and Likun Wang and Bin Shuai and Jingliang Duan and Shengbo Eben Li},
journal= {arXiv preprint arXiv:2507.01381},
year = {2025}
}
备注
Accepted IEEE ITSC 2025