视觉编码器的激活量化需要前缀寄存器
机器学习
2026-03-20 v4 计算机视觉与模式识别
摘要
大型预训练视觉编码器是多模态智能的核心,驱动来自设备内视觉处理到视觉语言模型等各类应用。由于这些应用常常需要处理海量视觉数据以实现实时处理,降低视觉编码器的推理成本至关重要。量化虽然是一条实用路径,但即便在8位精度下,由于所谓的异常值问题,仍然具有挑战性。本文提出了,一种无需训练的算法,可作为可叠加在其他量化方法之上的插件模块,用于缓解大规模预训练视觉编码器中的异常值。RegCache引入异常值易发但语义无关的前缀标记到视觉编码器中,以防止其他标记产生异常值。值得注意的是,我们观察到视觉编码器中的异常值与语言模型中的异常值行为不同,这促使我们提出两种技术创新:中层前缀化和标记删除。实验结果表明,我们的方法在各种视觉编码器上均能一致提升量化模型性能,尤其在极低位宽 regime(例如4位)中效果尤为突出。
引用
@article{arxiv.2510.04547,
title = {Activation Quantization of Vision Encoders Needs Prefixing Registers},
author = {Seunghyeon Kim and Taesun Yeom and Jinho Kim and Wonpyo Park and Kyuyeun Kim and Jaeho Lee},
journal= {arXiv preprint arXiv:2510.04547},
year = {2026}
}
备注
under review; 28 pages, 9 figures