FlowQ:基于能量引导的流模型用于离线强化学习
机器学习
2025-05-21 v1 人工智能
机器人学
摘要
在扩散模型中利用引导将抽样引导至所需结果的做法已在图像和轨迹生成等应用中得到广泛探索。然而,在训练期间融入引导的做法仍相对不太被探索。在本 work 中,我们提出能量引导流匹配(energy-guided flow matching),以增强流模型训练,消除推理时使用引导的需求。我们通过将能量引导概率路径近似为高斯路径来学习对应流策略的条件速度场。学习引导轨迹在目标分布由数据和能量函数组合定义的任务中具有吸引力,如强化学习中所见。扩散基策略最近因其表达力强且能够捕获多模态动作分布而受到关注。通常,这些策略通过加权目标或对由策略采样的动作进行反向传播来优化。作为一种替代方法,我们提出 FlowQ,这是一种基于能量引导流匹配的离线强化学习算法。我们的方法在实现竞争性能的同时,策略训练时间与流采样步骤数呈常数关系。
引用
@article{arxiv.2505.14139,
title = {FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning},
author = {Marvin Alles and Nutan Chen and Patrick van der Smagt and Botond Cseke},
journal= {arXiv preprint arXiv:2505.14139},
year = {2025}
}