中文

Shallow-π:面向基于流的视觉-语言-动作模型的知识蒸馏

机器人学 2026-01-29 v1

摘要

对实时机器人部署日益增长的需求促使视觉-语言-动作(VLA)模型实现快速且设备端推理。在VLA文献中,效率已在令牌级别得到广泛研究,例如视觉令牌剪枝。相比之下,系统性的Transformer层缩减受到的关注有限,并且据我们所知,尚未在知识蒸馏下针对基于流的VLA模型进行探索。在这项工作中,我们提出了Shallow-pi,一个原则性的知识蒸馏框架,它大幅减少了VLM骨干网络和基于流的动作头的Transformer深度,将模型从18层压缩至6层。Shallow-pi在标准操作基准上实现了超过两倍的推理加速,同时成功率绝对下降不到百分之一,在精简VLA模型中建立了最先进的性能。至关重要的是,我们通过在Jetson Orin和Jetson Thor上跨多个机器人平台(包括人形系统)的工业级真实世界实验,在复杂和动态的操作场景中验证了我们的方法。

关键词

引用

@article{arxiv.2601.20262,
  title  = {Shallow-{\pi}: Knowledge Distillation for Flow-based VLAs},
  author = {Boseong Jeon and Yunho Choi and Taehan Kim},
  journal= {arXiv preprint arXiv:2601.20262},
  year   = {2026}
}