中文

大视觉语言模型扰动鲁棒性基准测试:判别性基准与鲁棒性对齐度量

计算机视觉与模式识别 2025-11-25 v1

摘要

尽管大视觉语言模型(LVLMs)具有显著的推理能力,但其在视觉扰动下的鲁棒性仍研究不足。现有的评估范式存在两个主要局限:1)当前数据集中低判别性样本的主导地位掩盖了模型间的真实鲁棒性差距;2)传统的基于准确率的度量无法捕捉底层预测结构的退化。为弥补这些差距,我们引入了Bench-C,一个强调判别性样本以评估扰动鲁棒性的综合基准,其中提出了一种选择策略,同时考虑扰动下的预测不一致性和语义多样性。此外,我们提出了鲁棒性对齐分数(RAS),一种通过考虑预测不确定性的变化和校准对齐来衡量logit层预测结构退化的统一度量。全面的实验和分析揭示了几个有趣的发现:1)模型行为在扰动下表现出可区分的模式,如错误的置信度和犹豫;2)尽管细微扰动可能带来轻微的准确率提升,但整体预测结构仍然退化;3)通过将扰动鲁棒性分解为破坏性和纠正性分量,可以揭示不同模型之间独特的失败和恢复模式。

关键词

引用

@article{arxiv.2511.19032,
  title  = {Benchmarking Corruption Robustness of LVLMs: A Discriminative Benchmark and Robustness Alignment Metric},
  author = {Xiangjie Sui and Songyang Li and Hanwei Zhu and Baoliang Chen and Yuming Fang and Xin Sun},
  journal= {arXiv preprint arXiv:2511.19032},
  year   = {2025}
}

备注

15 pages