中文

基于瞬时速度约束的均值流动策略用于单步动作生成

机器学习 2026-03-10 v2 人工智能

摘要

学习具有表达性和效率的策略函数是强化学习中的一个有前景的方向。虽然流动策略最近在建模复杂动作分布并实现快速确定性采样方面证明有效,但它们仍面临表达性与计算负担之间的权衡,这通常由流动步骤数控制。在本工作中,我们提出了均值速度策略(MVP),这是一种新的生成策略函数,通过建模均值速度场实现最快的单步动作生成。为确保其高度表达性,引入了均值速度场上的瞬时速度约束(IVC),在训练期间施加该约束。我们理论上证明,该设计明确作为关键边界条件,从而提高学习准确性并增强策略的表达性。实验上,我们的 MVP 在来自 Robomimic 和 OGBench 的几个具有挑战性的机器人操控任务中实现了最先进的成功率。它还在现有流动策略基线的训练和推理速度上实现了显著的改进。

关键词

引用

@article{arxiv.2602.13810,
  title  = {Mean Flow Policy with Instantaneous Velocity Constraint for One-step Action Generation},
  author = {Guojian Zhan and Letian Tao and Pengcheng Wang and Yixiao Wang and Yiheng Li and Yuxin Chen and Hongyang Li and Masayoshi Tomizuka and Shengbo Eben Li},
  journal= {arXiv preprint arXiv:2602.13810},
  year   = {2026}
}

备注

ICLR Oral Presentation