通过高效且富有表达能力的 Shortcut 模型扩展离线强化学习
机器学习
2025-05-30 v1 人工智能
摘要
扩散和流模型已成为强大的生成方法,能够建模多样化和多模态的行为。然而,由于噪声采样过程的迭代性质,将这些模型应用于离线强化学习(RL)仍然具有挑战性,使得策略优化变得困难。在本文中,我们介绍了可扩展离线强化学习(SORL),这是一种新的离线 RL 算法,它利用 shortcut 模型——一类新型生成模型——来扩展训练和推理。SORL 的策略可以捕获复杂的数据分布,并且可以在一阶段训练过程中简单高效地进行训练。在测试时,SORL 通过使用学习到的 Q 函数作为验证器,引入了顺序和并行推理扩展。我们证明 SORL 在一系列离线 RL 任务中取得了强劲的表现,并随着测试时计算量的增加表现出正向的扩展行为。我们在 nico-espinosadice.github.io/projects/sorl 发布了代码。
引用
@article{arxiv.2505.22866,
title = {Scaling Offline RL via Efficient and Expressive Shortcut Models},
author = {Nicolas Espinosa-Dice and Yiyi Zhang and Yiding Chen and Bradley Guo and Owen Oertell and Gokul Swamy and Kiante Brantley and Wen Sun},
journal= {arXiv preprint arXiv:2505.22866},
year = {2025}
}
备注
32 pages, 5 figures. Under review at NeurIPS 2025