CLIP 中的捕获效应:空间-语义早期退出绕过了量化坍缩
计算机视觉与模式识别
2026-05-27 v1 人工智能
摘要
在资源受限的硬件上部署视觉语言模型通常需要进行 INT8 量化,但在联合嵌入架构如 CLIP 中,这会引入一种与量化 CNN 分类器不同的失效模式:跨变换块积累的激活噪声扰动了多模态嵌入的方向,削弱了依赖于零样本检索的余弦对齐。我们将其表征为量化诱导的表示坍缩 (QIRC),并在 INT8 CLIP ViT-B/32 上进行量化,其中层级噪声信噪比从浅层的低于 10% 增长至第 11 层的 52%。我们提出 LRA-EE (基于层级表示感知的早期退出),通过空间-语义聚合(替换不成熟的浅层 [CLS] 为全局 patch-token 平均)、学习的多特征门控(置信度、Top-2 边际、空间激活方差)以及面向每层信息-噪声比的层自适应置信度阈值来绕过噪声饱和的深层。在 ImageNet-1K 零样本分类上,LRA-EE 将 FLOPs 降低 13.4%,并将 Top-1 准确率从 58.72% 提升至 61.16%,提高了 +2.44 个百分点。四象限分解揭示了捕获效应:9.5% 的样本在浅层退出时被正确分类,但在完整深度时因噪声丢失;仅有 7.1% 的样本遭遇相反情况。
引用
@article{arxiv.2605.26415,
title = {The Rescue Effect: Spatio-Semantic Early Exit Bypasses Quantization Collapse in CLIP},
author = {Kahyeon Nam and Hyesong Choi},
journal= {arXiv preprint arXiv:2605.26415},
year = {2026}
}