中文

分析视觉语言模型对常见损坏的鲁棒性

计算机视觉与模式识别 2025-04-22 v2

摘要

视觉语言模型 (VLM) 已展示出在理解和推理视觉和文本内容方面的显著能力。然而,针对常见图像损坏的鲁棒性仍未得到充分探索。本文我们提出了对 VLM 在19种来自ImageNet-C基准的损坏类型进行的全面分析,这些损坏分为四个类别:噪声、模糊、天气和数字扭曲。我们引入两个新的基准测试,TextVQA-C和GQA-C,系统评估损坏如何影响场景文本理解和基于对象的推理。我们的分析揭示了基于Transformer的 VLM 在不同任务中呈现出不同的脆弱模式:文本识别在模糊和雪噪声损坏下最为严重,而对象推理对雾和脉冲噪声等损坏更敏感。我们将这些观察与不同损坏的频率域特征相联系,揭示了Transformer内在对低频处理的偏好如何解释其差异化的鲁棒性模式。我们的发现为开发更具抗损坏性的视觉语言模型提供了宝贵的见解,以适应实际应用。

关键词

引用

@article{arxiv.2504.13690,
  title  = {Analysing the Robustness of Vision-Language-Models to Common Corruptions},
  author = {Muhammad Usama and Syeda Aishah Asim and Syed Bilal Ali and Syed Talal Wasim and Umair Bin Mansoor},
  journal= {arXiv preprint arXiv:2504.13690},
  year   = {2025}
}

备注

arXiv admin note: text overlap with arXiv:2304.10592, arXiv:2301.12597 by other authors