ActQuant:面向视觉-语言-动作模型的亚4位动作引导量化
计算机视觉与模式识别
2026-05-26 v1 人工智能
摘要
视觉-语言-动作 (VLA) 模型在具身智能中的动作生成方面表现突出,但其计算负担使得在边缘平台上部署实际不可行。激进的亚4位权重量化是自然的解决方案,但现有的后训练量化 (PTQ) 方法在此范围内会出现严重的性能下降。为此,我们引入 ActQuant,一种动作引导的混合精度 PTQ 框架,包含两个阶段:(1) 跨张量位分配器根据其对预测智能体动作贡献的大小为每个权重矩阵分配单个位宽;(2) intra-tensor 比例优化器使用动作感知曲率调整每个块的量化比例,以便将动态范围集中于对控制最有影响的权重。为实现激进量化的边缘部署优势,我们进一步引入 OmniModel.cpp,一个智能体化转换管道,可将模型移植到原生 C/C++ 运行时并实现高效低位内核。我们在仿真环境和真实世界的6自由度 UR3 机械臂上评估了 ActQuant,所有模型均通过 OmniModel.cpp 部署。在 LIBERO 基准测试中,ActQuant 是唯一一种在或低于3位/权重的方法,保持对 OpenVLA-OFT 的 95.0% 和 的 94.8%。进一步地,ActQuant 在 OpenVLA-OFT 上达到 2.5 bpw 时精度为 90.1%,将主干压缩从 14.3 GB 降至 2.7 GB(5.3倍)。在物理 UR3 机械臂上, 采用 ActQuant 量化后,保留了基线的成功率,同时将内存占用降低了 2.5倍。
引用
@article{arxiv.2605.24011,
title = {ActQuant: Sub-4-bit Action-Guided Quantization for Vision-Language-Action Models},
author = {Arash Akbari and Arman Akbari and Masih Eskandar and Qitao Tan and Yixiao Chen and Jingwu Luo and Bertha Pangaribuan and Liyun Zhang and Jennifer Dy and Geng Yuan and Xue Lin and Gaowen Liu and Stratis Ioannidis and Yanzhi Wang},
journal= {arXiv preprint arXiv:2605.24011},
year = {2026}
}