中文

通过高效且富有表达能力的 Shortcut 模型扩展离线强化学习

机器学习 2025-05-30 v1 人工智能

摘要

扩散和流模型已成为强大的生成方法,能够建模多样化和多模态的行为。然而,由于噪声采样过程的迭代性质,将这些模型应用于离线强化学习(RL)仍然具有挑战性,使得策略优化变得困难。在本文中,我们介绍了可扩展离线强化学习(SORL),这是一种新的离线 RL 算法,它利用 shortcut 模型——一类新型生成模型——来扩展训练和推理。SORL 的策略可以捕获复杂的数据分布,并且可以在一阶段训练过程中简单高效地进行训练。在测试时,SORL 通过使用学习到的 Q 函数作为验证器,引入了顺序和并行推理扩展。我们证明 SORL 在一系列离线 RL 任务中取得了强劲的表现,并随着测试时计算量的增加表现出正向的扩展行为。我们在 nico-espinosadice.github.io/projects/sorl 发布了代码。

关键词

引用

@article{arxiv.2505.22866,
  title  = {Scaling Offline RL via Efficient and Expressive Shortcut Models},
  author = {Nicolas Espinosa-Dice and Yiyi Zhang and Yiding Chen and Bradley Guo and Owen Oertell and Gokul Swamy and Kiante Brantley and Wen Sun},
  journal= {arXiv preprint arXiv:2505.22866},
  year   = {2025}
}

备注

32 pages, 5 figures. Under review at NeurIPS 2025