中文

面向离线强化学习的先验引导扩散规划

机器学习 2025-10-27 v2

摘要

扩散模型最近因其有效从静态数据集中学习出高性能、可泛化策略的能力而在离线强化学习中受到关注。基于返回最大化目标的扩散-based 规划器通过迭代去噪生成高质量轨迹,实现了长程决策。然而,现有的引导采样策略,如分类器引导、分类器-free 引导和蒙特卡洛样本选择,要么产生次优的多模态动作,要么在分布漂移方面难题,或因推断时间成本高而不可行。为此,我们提出了先验引导 (PG),这是一种新颖的引导采样框架,用行为正则化目标优化的可学习分布取代行为克隆扩散模型的标准高斯先验。PG 直接生成高价值轨迹,无需对扩散模型本身进行高成本的奖励优化,也无需在推断时进行多个候选样本的采样。我们提出了一种高效的训练策略,在潜空间中应用行为正则化,并经验性地证明 PG 在多样化的长程离线强化学习基准中超越了最先进的扩散策略和规划器。我们的代码可在 https://github.com/ku-dmlab/PG 上获得。

关键词

引用

@article{arxiv.2505.10881,
  title  = {Prior-Guided Diffusion Planning for Offline Reinforcement Learning},
  author = {Donghyeon Ki and JunHyeok Oh and Seong-Woong Shim and Byung-Jun Lee},
  journal= {arXiv preprint arXiv:2505.10881},
  year   = {2025}
}