视觉语言模型中的边缘可靠性差距:量化压缩VLM在视觉退化下的失效模式
计算机视觉与模式识别
2026-03-31 v1 人工智能
摘要
大型视觉语言模型(VLMs)的快速压缩以用于边缘部署引发了一个未被充分探讨的问题:紧凑模型是否以不同的方式失效,而不仅仅是更频繁地失效?本研究比较了一个70亿参数的量化VLM(Qwen2.5-VL-7B, 4-bit NF4)与一个5亿参数的FP16模型(SmolVLM2-500M),在来自VQAv2和COCO Captions的4000个样本上进行。三类错误分类法(目标盲视、语义漂移、先验偏差)被用作诊断框架。一个纯文本GPT-4o裁判揭示语义漂移(B)在VQAv2和COCO上是Qwen的主导失效模式,而在COCO上SmolVLM2呈现混合的目标盲视/语义漂移特征;先验偏差(C)在VQAv2上存在于两个模型,但在COCO上均不存在。通过几何平均token概率测量置信度校准,通过四个模板的结构化否定推理探针探测组合推理,以及模糊鲁棒性实验完成评估。对于这一模型对,紧凑模型展现出定性不同的失效特征:在COCO上否定崩溃幅度大12.5个百分点(-33.2pp vs. -20.8pp,Wald 95%置信区间[8.2, 16.8]pp,p < 10^-8),几乎完全由COCO驱动,而VQAv2差距不具有统计显著性(4.5pp,p=0.19)。最具区分力的模板是false_yn:SMOLVLM2-500M在100%的COCO试验中回答"是"(错误地声称 depicted object 不存在),而Qwen2.5-VL-7B为14%。非对称的数据集依赖校准偏差和具有两个对照消融的模糊实验完成了分析。完全可复现的流水线在边缘部署前用于压缩VLM的系统安全审计而发布。
引用
@article{arxiv.2603.26769,
title = {Edge Reliability Gap in Vision-Language Models: Quantifying Failure Modes of Compressed VLMs Under Visual Corruption},
author = {Mehmet Kaan Erol},
journal= {arXiv preprint arXiv:2603.26769},
year = {2026}
}
备注
16 pages, 5 figures