中文

基于熵调节器的扩散Actor-Critic算法

机器学习 2024-12-24 v5 人工智能

摘要

强化学习(RL)在处理复杂的决策和控制任务方面已被证明非常有效。然而,在大多数传统RL算法中,策略通常被参数化为具有学习均值和方差的对角高斯分布,这限制了它们获取复杂策略的能力。针对这一问题,我们提出了一种在线RL算法,称为基于熵调节器的扩散Actor-Critic(DACER)。该算法将扩散模型的反向过程概念化为一种新颖的策略函数,并利用扩散模型拟合多模态分布的能力,从而增强了策略的表示能力。由于扩散策略的分布缺乏解析表达式,其熵无法解析确定。为了缓解这一问题,我们提出了一种利用高斯混合模型估计扩散策略熵的方法。基于估计的熵,我们可以学习一个参数α\alpha,该参数调节探索和利用的程度。参数α\alpha将用于自适应地调节应用于扩散模型输出动作的附加噪声的方差。在MuJoCo基准测试和一个多模态任务上的实验表明,DACER算法在大多数MuJoCo控制任务中达到了最先进的性能,同时展现出扩散策略更强的表示能力。

关键词

引用

@article{arxiv.2405.15177,
  title  = {Diffusion Actor-Critic with Entropy Regulator},
  author = {Yinuo Wang and Likun Wang and Yuxuan Jiang and Wenjun Zou and Tong Liu and Xujie Song and Wenxuan Wang and Liming Xiao and Jiang Wu and Jingliang Duan and Shengbo Eben Li},
  journal= {arXiv preprint arXiv:2405.15177},
  year   = {2024}
}

备注

NeurIPS2024 Accepted