中文

轻量化VLA模型的时空动力学解锁:最小开销

计算机视觉与模式识别 2025-12-02 v1 机器人学

摘要

基于预训练视觉语言模型(VLM)构建的视觉语言动作(VLA)模型显示出强大的潜力,但因参数规模大在实际应用中受限。为缓解此问题,已探索使用轻量级VLM,但会损失时空推理能力。虽然某些方法认为纳入额外3D输入有助于改善,但通常依赖大型VLM来融合3D和2D输入,仍缺乏对时间的理解。因此,我们提出SwiftVLA—an一种增强紧凑模型具备4D理解能力 while 保持设计效率的架构。具体而言,我们的方案包含一个带有时空缓存的预训练4D视几何变换器,从2D图像中提取4D特征。然后,为增强VLM的能力以利用2D图像和4D特征,我们引入Fusion Tokens——一组在未来预测目标下进行训练的可学习标记,用于生成动作生成的统一表示。最后,我们引入一种掩码-重构策略,对VLM的4D输入进行掩码处理,并训练VLA重构这些输入,使VLM能够学习有效的4D表示,同时在推理时可丢弃4D分支,几乎不损失性能。实验在真实和模拟环境中表明,SwiftVLA在轻量基线上超越,且与规模可达7倍的VLA相当,在边缘设备上实现 comparable performance,速度快18倍,内存占用减少12倍。

关键词

引用

@article{arxiv.2512.00903,
  title  = {SwiftVLA: Unlocking Spatiotemporal Dynamics for Lightweight VLA Models at Minimal Overhead},
  author = {Chaojun Ni and Cheng Chen and Xiaofeng Wang and Zheng Zhu and Wenzhao Zheng and Boyuan Wang and Tianrun Chen and Guosheng Zhao and Haoyun Li and Zhehao Dong and Qiang Zhang and Yun Ye and Yang Wang and Guan Huang and Wenjun Mei},
  journal= {arXiv preprint arXiv:2512.00903},
  year   = {2025}
}