中文

加速会导致视觉语言模型中隐藏的不稳定性吗?通过大规模实证研究揭示实例级发散

计算机视觉与模式识别 2025-09-03 v4 计算与语言

摘要

视觉语言模型 功能强大,但在广泛实际部署中计算量大。为了在不付出高昂再训练成本的情况下应对这一挑战,后训练加速技术(如量化和 token 减少)得到了广泛探索。然而,当前的加速评估主要针对最小的整体性能下降,忽略了一个关键问题:加速后的模型是否仍然像加速前一样对相同的问题给出相同的答案?这对于以稳定性为中心的工业应用至关重要,在这些应用中,对特定已知情况始终给出正确答案是最重要的,例如在基于 AI 的疾病诊断中。我们针对加速的 VLM 系统地研究了这个问题,在十个多模态基准上用八种加速方法测试了四个领先模型 (LLaVA-1.5, LLaVA-Next, Qwen2-VL, Qwen2.5-VL)。我们的发现很严峻:尽管总体性能下降微乎其微,但加速后的模型有多达 20% 的时间改变了原始答案。关键的是,这些改变中有多达 6.5% 将正确答案变成了错误答案。输入扰动放大了这些不一致性,并且这一趋势得到了医学 VLM LLaVA-Med 的案例研究的证实。本研究揭示了 VLM 加速中的一个重大疏忽,强调迫切需要进行实例级稳定性检查,以确保值得信赖的真实世界部署。

关键词

引用

@article{arxiv.2503.06794,
  title  = {Does Acceleration Cause Hidden Instability in Vision Language Models? Uncovering Instance-Level Divergence Through a Large-Scale Empirical Study},
  author = {Yizheng Sun and Hao Li and Chang Xu and Hongpeng Zhou and Chenghua Lin and Riza Batista-Navarro and Jingyuan Sun},
  journal= {arXiv preprint arXiv:2503.06794},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 Main Conference