中文

基于Q学习的一步生成策略:对MeanFlow的一种重构

机器学习 2025-11-18 v1 人工智能

摘要

我们提出一种针对离线强化学习的一步生成策略,将噪声直接映射到动作,通过对MeanFlow进行残差重构,使其兼容Q学习。虽然一步高斯策略可实现快速推断,但难以捕获复杂、多模态的动作分布。现有基于流的方法在使用Q学习训练时通常依赖蒸馏和两阶段训练。为克服这些限制,我们提出将MeanFlow重构以启用直接的噪声到动作生成,通过将速度场和噪声到动作转换集成到单个策略网络中,以消除对单独速度估计的需求。我们探索了多种重构变体,确定一种有效的残差重构方案,以支持具有表达性和稳定性的策略学习。我们的方法具有三个关键优势:1)高效的一步噪声到动作生成,2)对多模态动作分布的表达建模,3)在单个训练阶段中实现高效和稳定的Q学习策略学习。在覆盖OGBench和D4RL基准的73个任务上的大量实验表明,我们的方法在离线和离线到在线强化学习设置中均取得了强劲的性能。代码可在 https://github.com/HiccupRL/MeanFlowQL 提供。

关键词

引用

@article{arxiv.2511.13035,
  title  = {One-Step Generative Policies with Q-Learning: A Reformulation of MeanFlow},
  author = {Zeyuan Wang and Da Li and Yulin Chen and Ye Shi and Liang Bai and Tianyuan Yu and Yanwei Fu},
  journal= {arXiv preprint arXiv:2511.13035},
  year   = {2025}
}

备注

Accepted in AAAI 2026 Poster