从压缩机制解读视觉语言模型
人工智能
2026-03-27 v1
摘要
压缩后的视觉语言模型(VLM)广泛用于减少内存和计算成本,因而非常适合实际部署。然而,对这些模型进行压缩引发了是否保留内部计算和安全行为的担忧。本文使用因果电路分析和跨编码器特征比较,探讨剪枝和量化如何在代表性视觉语言模型中根本性地改变内部结构。我们观察到,剪枝通常保持电路结构完整,但旋转和衰减内部特征;而量化则在更高层次上修改电路,但使存活特征更好地对齐。基于这一洞察,我们还引入了 VLMSafe-420,一个新颖的基准,针对各种安全类别将有害输入与匹配的良性反事实输入配对。我们的发现表明,剪枝会导致真正拒绝行为的显著下降,表明压缩方式的选择具有安全影响。
引用
@article{arxiv.2603.25035,
title = {Mechanistically Interpreting Compression in Vision-Language Models},
author = {Veeraraju Elluru and Arth Singh and Roberto Aguero and Ajay Agarwal and Debojyoti Das and Hreetam Paul},
journal= {arXiv preprint arXiv:2603.25035},
year = {2026}
}
备注
15 pages, 7 figures, 12 tables