MP1:MeanFlow 在机器人操控中实现一步策略学习
机器人学
2025-12-04 v5
摘要
在机器人操控领域,机器人学习已成为主流方法。然而,这一领域的生成模型面临着扩散模型缓慢、迭代采样与更快基于 Flow 方法的架构约束之间的根本性权衡,这些方法通常依赖显式一致性损失。为解决这些限制,我们引入 MP1,将 3D 点云输入与 MeanFlow 框架结合,以在一个网络函数评估(1-NFE)中生成动作轨迹。通过直接学习区间平均速度的"MeanFlow 同一性",我们的策略无需任何额外一致性约束。该表述在推理期间消除了数值 ODE 求解误差,产生更精确的轨迹。MP1 进一步集成 CFG 以提高轨迹可控性,同时保持 1-NFE 推理,不会重新引入结构约束。由于细微的场景上下文变化对于机器人学习尤其在少样本学习中至关重要,我们引入轻量级的 Dispersive Loss,以在训练期间对状态嵌入进行排斥,提升泛化能力而不减慢推理速度。我们在 Adroit 和 Meta-World 基准测试中进行验证,并在实际场景中进行测试。实验结果显示,MP1 在平均任务成功率方面表现优异,分别比 DP3 高出 10.2%,比 FlowPolicy 高出 7.3%。其平均推理时间仅为 6.8 毫秒,较 DP3 快 19 倍, nearly 比 FlowPolicy 快约 2 倍。我们的项目页面位于 https://mp1-2254.github.io/,代码可在 https://github.com/LogSSim/MP1 获取。
引用
@article{arxiv.2507.10543,
title = {MP1: MeanFlow Tames Policy Learning in 1-step for Robotic Manipulation},
author = {Juyi Sheng and Ziyi Wang and Peiming Li and Mengyuan Liu},
journal= {arXiv preprint arXiv:2507.10543},
year = {2025}
}
备注
This paper has been accepted by AAAI 2026