中文

通过 Q 得分匹配从奖励中学习扩散模型策略

机器学习 2025-02-17 v5 人工智能

摘要

扩散模型已成为在行为克隆和离线强化学习中表示执行者策略的流行选择。这是因为它们具有在连续空间上优化具有强表达能力的分布类的天然能力。然而,先前的工作未能利用扩散模型基于得分的结构,而是利用简单的行为克隆项来训练执行者,限制了其在执行者-评论家环境中的能力。在本文中,我们提出了一个理论框架,通过将策略得分的结构与 Q 函数的动作梯度联系起来,将扩散模型策略的结构与学习到的 Q 函数联系起来。我们专注于离策略强化学习,并基于该理论提出了一种新的策略更新方法,我们将其称为 Q 得分匹配。值得注意的是,该算法只需对去噪模型进行微分,而无需对整个扩散模型评估进行微分,并且通过 Q 得分匹配收敛的策略在连续域中隐式地表现为多模态和探索性。我们在模拟环境中进行了实验,以证明我们提出方法的可行性,并与流行的基线进行了比较。源代码可从项目网站获取:https://michaelpsenka.io/qsm。

关键词

引用

@article{arxiv.2312.11752,
  title  = {Learning a Diffusion Model Policy from Rewards via Q-Score Matching},
  author = {Michael Psenka and Alejandro Escontrela and Pieter Abbeel and Yi Ma},
  journal= {arXiv preprint arXiv:2312.11752},
  year   = {2025}
}

备注

ICML 2024. 21 pages, 9 figures