中文

一步流策略:用于快速视觉运动策略的自蒸馏

机器人学 2026-03-16 v1 人工智能

摘要

生成式流和扩散模型提供了用于高精度机器人策略所需的连续、多模态动作分布。然而,它们依赖于迭代抽样,导致严重的推理延迟,降低控制频率并损害时间敏感操作中的性能。为此,我们提出了 One-Step Flow Policy (OFP),一个从零开始的自蒸馏框架,用于在无需预训练教师的条件下实现高保真、单步动作生成。OFP 统一了自一致性损失以确保跨时间间隔的稳定运输,以及自引导正则化以将预测锐化至高密度专家模式。此外,一种温暖启动机制利用时序动作相关性来最小化生成式运输距离。在 56 个多样化模拟操作任务上的评估表明,单步 OFP 实现了最先进的成绩,超过了 100 步的扩散和流策略,同时将动作生成加速了 100 倍以上。我们进一步将 OFP 集成到 RoboTwin 2.0 上的 π0.5\pi_{0.5} 模型中,其中单步 OFP 超过原始 10 步策略。这些结果表明 OFP 是一种实用且可扩展的解决方案,能够实现高度准确和低延迟的机器人控制。

关键词

引用

@article{arxiv.2603.12480,
  title  = {One-Step Flow Policy: Self-Distillation for Fast Visuomotor Policies},
  author = {Shaolong Li and Lichao Sun and Yongchao Chen},
  journal= {arXiv preprint arXiv:2603.12480},
  year   = {2026}
}