中文

面向模型基强化学习的优势引导扩散

人工智能 2026-04-13 v1 机器学习

摘要

基于自回归世界模型的模型基强化学习 (MBRL) 因误差叠加而受限,而扩散世界模型通过联合生成轨迹片段来缓解这一问题。然而,现有的扩散引导要么仅基于策略,忽略价值信息,要么基于奖励,在扩散 horizon 较短时变得昏薄。我们提出了基于优势引导的扩散模型用于 MBRL (AGD-MBRL),通过智能体的优势估计来引导逆扩散过程,以便抽样集中于预期在生成窗口之外能获得更高长期回报的轨迹。我们发展了两种引导方法:(i) Sigmoid优势引导 (SAG),和 (ii) 指数优势引导 (EAG)。我们证明了通过SAG或EAG引导的扩散模型,允许我们对轨迹进行重新加权,权重随状态-动作优势而增加——在标准假设下,这意味着策略改进。此外,我们展示了来自AGD-MBRL生成的轨迹遵循改进的策略(即更高价值),而无引导扩散模型如此。AGD能够无缝集成到PolyGRAD风格的架构中,通过引导状态组件而保持动作生成的 policy 条件化,且不需要更改扩散训练目标。在MuJoCo控制任务(HalfCheetah、Hopper、Walker2D和Reacher)上,AGD-MBRL在PolyGRAD、基于在线Diffuser风格奖励引导的模型以及模型自由基线(PPO/TRPO)方面提高了样本效率和最终回报,某些情况下提升幅度可达2倍。这些结果表明,优势感知的引导是缓解扩散模型 MBRL 中短 horizon 昏薄的简单且有效的解决方案。

关键词

引用

@article{arxiv.2604.09035,
  title  = {Advantage-Guided Diffusion for Model-Based Reinforcement Learning},
  author = {Daniele Foffano and Arvid Eriksson and David Broman and Karl H. Johansson and Alexandre Proutiere},
  journal= {arXiv preprint arXiv:2604.09035},
  year   = {2026}
}