基于生成轨迹策略的离线强化学习
机器学习
2026-05-29 v2 人工智能
摘要
生成模型作为离线强化学习(RL)中强大的政策类,因其捕获复杂、多模态行为的能力而备受推崇。然而,现有方法面临明显的权衡:慢速、迭代的模型如扩散政策计算代价高昂,而快速、单步模型如一致性政策常因性能下降而受影响。本文证明,完全可以弥合这一鸿沟。我们认为超越单一方法局限的关键在于将现代生成模型,包括扩散、流匹配和一致性模型,视为特定于学习由普通微分方程(ODE)支配的连续时间生成轨迹的实例。这种原则性的基础为生成政策在 RL 中的设计空间提供了更清晰的框架,使我们能够提出生成轨迹政策(Generative Trajectory Policies, GTPs),即一种新的、更通用的政策范式,通过学习 underlying ODE 的解的整个映射来实现。为使该范式在离线 RL 中实用,我们进一步引入两个关键的理论原则性适应。经验结果表明,GTP 在 D4RL 基准测试中实现了最先进的性能——在几个 notoriously 难的 AntMaze 任务中实现完美得分。
引用
@article{arxiv.2510.11499,
title = {Offline Reinforcement Learning with Generative Trajectory Policies},
author = {Xinsong Feng and Leshu Tang and Chenan Wang and Haipeng Chen},
journal= {arXiv preprint arXiv:2510.11499},
year = {2026}
}
备注
ICML 2026