中文

Omega-QVLA: 通过组合旋转和分步骤缩放实现面向视觉-语言-动作模型的鲁棒量化

计算机视觉与模式识别 2026-05-28 v1 机器学习

摘要

视觉-语言-动作(VLA)模型统一了感知、推理和控制于单个策略中,但其数十亿参数背bone和基于扩散的动作head使得设备端部署昂贵。先前的量化方法仅提供部分解决方案,压缩LLM背bone而将DiT动作head保持全精度,或采用混合精度方案,基于将统一量化动作head本质上不稳定的信念。我们挑战了这一假设,提出Omega-QVLA,首个实现对VLA模型语言背bone和整个扩散动作head统一压缩至W4A4精度的训练-free后训练量化框架,无需混合精度分配。Omega-QVLA结合了组合SVD-Hadamard旋转,以均衡每个通道权重能量,同时通过分步骤DiT激活缩放量化来吸收去噪步骤中的动态范围漂移。在LIBERO上,Omega-QVLA将Pi 0.5和GR00T N1.5压缩至W4A4,分别实现98.0%和87.8%的任务成功率,匹配或超过其FP16参考值(97.1%和87.0%),同时降低静态内存占用71.3%。真实世界的操纵实验进一步确认,在先前方法失败的情况下,Omega-QVLA实现了顺畅、准确的操纵。代码可在https://github.com/UCMP13753/Omega-QVLA获取。

关键词

引用

@article{arxiv.2605.28803,
  title  = {{\Omega}-QVLA: Robust Quantization for Vision-Language-Action Models via Composite Rotation and Per-step Scaling},
  author = {Xinyu Wang and Mingze Li and Sicheng Lyu and Dongxiu Liu and Kaicheng Yang and Ziyu Zhao and Yufei Cui and Xiao-Wen Chang and Peng Lu},
  journal= {arXiv preprint arXiv:2605.28803},
  year   = {2026}
}