中文

量化对视觉语言模型影响的系统评估: 超越准确率的可靠性

计算机视觉与模式识别 2026-05-18 v6 人工智能 机器学习

摘要

视觉语言模型(VLM)如 CLIP 已在零样本分类和安全关键任务(包括 OOD 检测)中取得突出成绩。然而, 其高计算成本阻碍了高效的实际部署。虽然量化是提高效率的标准解决方案, 但其对仅限于简单 Top-1 准确率之外可靠性指标的影响仍受到严重不足的关注。本研究对 VLM 量化进行大规模评估, 包含超过 70 万次评估运行, 涉及多种配置。我们发现, 与量化噪声降低性能的假设相反, 量化可同时提升准确率、校准、OOD 检测和对噪声的鲁棒性, 虽然对协变量漂移和伪相关性的鲁棒性不足。我们利用这些反直觉发现来刻画量化的作用机制: 我们展示量化抑制了高秩谱分量, 迫使模型更依赖于稳健的低秩特征。最终, 这种谱滤波效应驱动了对泛化和噪声容忍性的提升, 为通过超越其传统角色的量化部署更快更可靠的 VLM 铺平了道路。

关键词

引用

@article{arxiv.2509.21173,
  title  = {Less Precise Can Be More Reliable: A Systematic Evaluation of Quantization's Impact on VLMs Beyond Accuracy},
  author = {Aymen Bouguerra and Daniel Montoya and Alexandra Gomez-Villa and Chokri Mraidha and Fabio Arnez},
  journal= {arXiv preprint arXiv:2509.21173},
  year   = {2026}
}

备注

Accepted at ICML 2026