与最优Q引导对齐的流动图政策
机器学习
2026-05-13 v1
摘要
基于高度多模态动作分布的表达模型(如扩散和流匹配)的生成政策非常适用于复杂控制问题,但其推理成本高昂:生成每个动作通常需要模拟许多推理步骤,在顺序决策滚动中导致延迟叠加。我们提出流动图政策(flow map policies),这是一类为快速动作生成而设计的生成政策,通过学习对现有生成流程进行任意大小的跳跃(包括一步跳跃)来实现。我们在离线到在线强化学习(RL)中实例化流动图政策,并将在线适应性形式化为一个信任区域优化问题,在保持接近离线政策的同时提高批评家的Q值。我们理论地推导了FLOW MAP Q-GUIDANCE(FMQ),这是一种在批评家引导的信任区域约束下适应离线流动图政策的最优闭式学习目标。我们进一步引入Q-GUIDED BEAM SEARCH(QGBS),这是一种结合re-noising和束搜索的随机流图采样器,实现在推理时间进行迭代细化。我们在OGBench和RoboMimic上的12个具有挑战性的机器人操控和运动任务中,FMQ在离线到在线RL中实现了最佳性能,平均成功率相较于之前的一步政策MVP提升了21.3%。
引用
@article{arxiv.2605.12416,
title = {Aligning Flow Map Policies with Optimal Q-Guidance},
author = {Christos Ziakas and Alessandra Russo and Avishek Joey Bose},
journal= {arXiv preprint arXiv:2605.12416},
year = {2026}
}