Guided Flow Policy:基于离线强化学习中高价值动作的学习方法
机器学习
2026-03-06 v2 人工智能
摘要
离线强化学习通常依赖行为正则化来强制策略保持接近数据分布。然而,这类方法在正则化组件中无法区分高价值动作和低价值动作。我们引入 Guided Flow Policy (GFP),将多步骤流匹配策略与提炼的单步骤演员耦合。该演员通过加权行为克隆引导流政策,聚焦于从数据集中克隆高价值动作,而非盲目模仿所有状态-动作对。在此基础上,流政策约束演员保持与数据集最佳转换的一致性,同时最大化评论家价值。这种相互指导使 GFP 在 OGBench、Minari 和 D4RL 框架下的 144 个状态和像素基任务中实现了最先进的性能,在次优数据集和具有挑战性的任务上取得了显著提升。网页:https://simple-robotics.github.io/publications/guided-flow-policy/
引用
@article{arxiv.2512.03973,
title = {Guided Flow Policy: Learning from High-Value Actions in Offline Reinforcement Learning},
author = {Franki Nguimatsia Tiofack and Théotime Le Hellard and Fabian Schramm and Nicolas Perrin-Gilbert and Justin Carpentier},
journal= {arXiv preprint arXiv:2512.03973},
year = {2026}
}