中文

扩散引导是一种可控的策略改进算子

机器学习 2025-05-30 v1

摘要

强化学习的核心理念是学习超越数据中的性能。然而,事实证明扩展此类系统出了名地棘手。相比之下,生成模型的技术已被证明具有出色的可扩展性且易于训练。在本工作中,我们结合了这些优势,推导出策略改进与扩散模型引导之间的直接关系。由此产生的框架 CFGRL 以监督学习的简单性进行训练,但能进一步提升数据中策略的性能。在离线强化学习任务中,我们观察到一个可靠的趋势——增加引导权重会带来性能的提升。尤为重要的是,CFGRL 无需显式学习价值函数即可运行,这使我们能够将简单的监督方法(例如,目标条件行为克隆)推广以进一步优先考虑最优性,从而全面“免费”获得性能提升。

关键词

引用

@article{arxiv.2505.23458,
  title  = {Diffusion Guidance Is a Controllable Policy Improvement Operator},
  author = {Kevin Frans and Seohong Park and Pieter Abbeel and Sergey Levine},
  journal= {arXiv preprint arXiv:2505.23458},
  year   = {2025}
}