中文

HBVLA:面向视觉-语言-动作模型的 1 位后训练量化

机器学习 2026-02-17 v1

摘要

视觉-语言-动作 (VLA) 模型使能够遵循指令的具身控制成为可能,但其庞大的计算和内存占用阻碍了在资源受限的机器人和边缘平台上的部署。虽然通过二值化将权重降至 1 位可显著提升效率,但现有方法未能缩小二值化权重与全精度权重之间的分布差距,导致在长时程闭环执行期间,量化误差会累积,严重降低动作性能。为填补这一差距,我们提出了 HBVLA,一个为 VLA 量身定制的二值化框架。首先,我们使用基于策略的增强 Hessian 来识别真正关键于动作生成的权重。随后,我们对非显著权重采用稀疏正交变换,以诱导出低熵中间状态。最后,我们在哈尔领域对显著与非显著权重进行基于组的 1 位量化。我们在不同的 VLA 上进行了评估:在 LIBERO 上,量化后的 OpenVLA-OFT 保留了 92.2% 的全精度性能;在 SimplerEnv 上,量化后的 CogAct 保留了 93.6% 性能,显著优于现有领先的二值化方法。我们进一步在真实世界评估套件上验证了该方法,结果显示 HBVLA 仅会产生轻微的成功率下降,表明其在严格的硬件约束条件下具有稳健的可部署性。我们的工作为 VLA 的超低位量化提供了实用的基础,使更可靠地部署到硬件受限的机器人平台成为可能。

关键词

引用

@article{arxiv.2602.13710,
  title  = {HBVLA: Pushing 1-Bit Post-Training Quantization for Vision-Language-Action Models},
  author = {Xin Yan and Zhenglin Wan and Feiyang Ye and Xingrui Yu and Hangyu Du and Yang You and Ivor Tsang},
  journal= {arXiv preprint arXiv:2602.13710},
  year   = {2026}
}