SnapFlow:通过渐进自蒸馏实现流匹配VLA的单步动作生成
计算机视觉与模式识别
2026-04-08 v1 人工智能
摘要
基于流匹配的视觉-语言-动作(VLA)模型——如pi0、pi0.5和SmolVLA——实现了最先进的通用机器人操控,但其迭代去噪通常需要10个ODE步骤,引入大量延迟:在现代GPU上,仅去噪就占端到端推理时间的80%。简单地减少步骤数是不可靠的,由于速度场未针对单步跳跃进行校准,大多数任务的成功率会下降。我们提出了SnapFlow,一种即插即用的自蒸馏方法,可将多步骤去噪压缩为单次前向传播(1-NFE),适用于流匹配VLA模型。SnapFlow将标准流匹配样本与一致性样本混合,一致性样本的目标是从模型自身边际速度预测计算的两步欧拉捷径速度,从而避免条件速度引起的轨迹漂移,我们对此进行了理论分析。一个零初始化的目标时间嵌入使网络能够在局部速度估计和全局单步生成之间切换。SnapFlow无需外部教师、无需架构更改,在单个GPU上训练约12小时。我们在两个跨越6倍参数范围的VLA架构上进行了验证,使用相同超参数:在pi0.5(3B)上跨越四个LIBERO套件(40个任务,400个片段),SnapFlow实现了98.75%的平均成功率——与10步教师模型(97.75%)相当并略微超过——去噪速度提升9.6倍,端到端延迟从274ms降至83ms;在SmolVLA(500M)上,MSE降低8.3%,端到端加速3.56倍。在长周期任务上的动作步长扫描显示,SnapFlow在整个执行周期中保持其优势,在n_act=5时达到93%,而基线仅达到90%。SnapFlow与层蒸馏和token剪枝方法正交,可实现组合加速。
引用
@article{arxiv.2604.05656,
title = {SnapFlow: One-Step Action Generation for Flow-Matching VLAs via Progressive Self-Distillation},
author = {Wuyang Luan and Junhui Li and Weiguang Zhao and Wenjian Zhang and Tieru Wu and Rui Ma},
journal= {arXiv preprint arXiv:2604.05656},
year = {2026}
}
备注
10 pages, 6 figures, 9 tables