中文

视觉标记剪枝是否改善校准?基于 MLLMs 的置信度实证研究

计算机视觉与模式识别 2026-04-15 v1

摘要

视觉标记剪枝是多模态大语言模型 (MLLMs) 中高效推断的常用策略,但现有研究主要以任务准确率为评估标准。本文探讨了视觉标记剪枝对模型校准(即预测置信度是否匹配实际正确性)的影响。使用 LLaVA-1.5-7B 在 POPE 和 ScienceQA-IMG 上评估了期望校准误差 (ECE)、Brier 分数和 AURC,在多种剪枝策略下(包括带不同显著性权重的 SCOPE、显著性-only 剪枝、FastV 和随机剪枝)以及多种 token 预算下。我们的结果表明,剪枝并非简单地以可靠性为代价换取效率。在 POPE 上,SCOPE 的纯覆盖设置在保持类似准确率的同时,实现了显著低于未剪枝模型的 ECE。内部 alpha 扫描进一步显示:在所测试的所有 token 预算下,降低显著性权重均可改善校准,而准确率仅轻微变化。相比之下,基于显著性的剪枝导致校准恶化,实际 FastV 在我们实验中引起严重性能下降。在 ScienceQA-IMG 上,剪枝也能降低 ECE,准确率保持稳定或略有提升。我们还研究了覆盖率选择中 gap power 指数的作用,发现其默认设置并非总是最优。总体而言,本文结果表明,视觉标记剪枝的评估不仅应关注准确率,也应关注置信度质量,尤其是对于需要可靠决策的多模态系统。

关键词

引用

@article{arxiv.2604.12035,
  title  = {Does Visual Token Pruning Improve Calibration? An Empirical Study on Confidence in MLLMs},
  author = {Kaizhen Tan},
  journal= {arXiv preprint arXiv:2604.12035},
  year   = {2026}
}