DeFlow:用于离线策略提取的流匹配范式下的流形建模与价值最大化解耦
机器学习
2026-01-21 v2
摘要
我们提出 DeFlow,一个解耦离线强化学习框架,利用流匹配(flow matching)真实捕捉复杂行为流形。优化生成策略计算代价高昂,通常需要通过 ODE 求解器进行反向传播。我们通过在流动流形中基于数据派生的显式信任区域内学习轻量级细化模块,而非牺牲迭代生成能力通过单步蒸馏。这使得我们绕过求解器微分,消除对平衡损失项的需求,确保稳定改进,同时完全保留流的迭代表达性。实验上,DeFlow 在具有挑战性的 OGBench 数据集上取得优异性能,并展示了有效的离线到在线适应能力。
引用
@article{arxiv.2601.10471,
title = {DeFlow: Decoupling Manifold Modeling and Value Maximization for Offline Policy Extraction},
author = {Zhancun Mu},
journal= {arXiv preprint arXiv:2601.10471},
year = {2026}
}
备注
14 pages, 3 figures