中文

视觉编码器的激活量化需要前缀寄存器

机器学习 2026-03-20 v4 计算机视觉与模式识别

摘要

大型预训练视觉编码器是多模态智能的核心,驱动来自设备内视觉处理到视觉语言模型等各类应用。由于这些应用常常需要处理海量视觉数据以实现实时处理,降低视觉编码器的推理成本至关重要。量化虽然是一条实用路径,但即便在8位精度下,由于所谓的异常值问题,仍然具有挑战性。本文提出了RegCache\textit{RegCache},一种无需训练的算法,可作为可叠加在其他量化方法之上的插件模块,用于缓解大规模预训练视觉编码器中的异常值。RegCache引入异常值易发但语义无关的前缀标记到视觉编码器中,以防止其他标记产生异常值。值得注意的是,我们观察到视觉编码器中的异常值与语言模型中的异常值行为不同,这促使我们提出两种技术创新:中层前缀化和标记删除。实验结果表明,我们的方法在各种视觉编码器上均能一致提升量化模型性能,尤其在极低位宽 regime(例如4位)中效果尤为突出。

关键词

引用

@article{arxiv.2510.04547,
  title  = {Activation Quantization of Vision Encoders Needs Prefixing Registers},
  author = {Seunghyeon Kim and Taesun Yeom and Jinho Kim and Wonpyo Park and Kyuyeun Kim and Jaeho Lee},
  journal= {arXiv preprint arXiv:2510.04547},
  year   = {2026}
}

备注

under review; 28 pages, 9 figures