中文

基于分数的单步 MeanFlow 策略优化

机器学习 2026-05-25 v1 人工智能

摘要

扩散和流匹配已成为强化学习中极具表达力的策略类,但它们对多步去噪的依赖在推理时带来了大量的计算开销,这在在线强化学习中尤为不利。MeanFlow 提供了一种有前景的替代方案,它通过学习一个平均速度场,在单次网络评估中将噪声映射到数据。然而,MeanFlow 通常需要来自目标分布的样本来构建其目标速度场,而这在在线强化学习中是不可用的。我们提出了基于分数的单步 MeanFlow 策略优化(SOM),这是一种演员-评论家算法,它通过分数估计和概率流 ODE 直接从 Q 函数构建目标速度场来解决这一问题,从而将概率质量集中在高价值模式上。在完全在线强化学习设定下,SOM 仅需单次生成步骤即可在运动控制任务上实现 SOTA 性能,同时与先前基于扩散和流匹配的策略相比,大幅减少了训练和推理时间。

关键词

引用

@article{arxiv.2605.23365,
  title  = {Score-Based One-step MeanFlow Policy Optimization},
  author = {Kyungyoon Kim and Donghyeon Ki and Hee-Jun Ahn and Byung-Jun Lee},
  journal= {arXiv preprint arXiv:2605.23365},
  year   = {2026}
}