中文

超越标准基准:面向多样化任务的视觉语言模型对自然语义变化的系统审计

计算机视觉与模式识别 2026-04-07 v1

摘要

近期视觉语言模型 (VLM) 通过 web 规模的图像-文本对实现了显著的零样迁移,能够在多样化的视觉任务中取得优异性能。然而,超越标准基准的全面且独立的评估对于理解其鲁棒性、局限性及实际应用至关重要。本文提出了一套用于评估 VLM 在自然对抗场景下对多样化下游任务鲁棒性的系统框架,这在以往评估工作中被忽视。我们评估了广泛的 VLM (CLIP、robust CLIP、BLIP2 和 SigLIP2),在精选对抗数据集上进行测试(包括排 Typography 攻击、ImageNet-A 以及自然语言诱导的对抗样本)。我们衡量了所选 VLM 在零样图像分类、语义分割和视觉问答中的自然对抗性能。我们的分析表明,robust CLIP 模型可能放大了自然对抗漏洞,CLIP 模型在自然语言诱导的对抗样本方面性能显著下降。此外,我们提供了可解释的分析,以识别故障模式。我们希望我们的发现能激发未来在鲁棒性和公平性多模态模式识别方面的研究。

关键词

引用

@article{arxiv.2604.04473,
  title  = {Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks},
  author = {Jia Chengyu and AprilPyone MaungMaung and Huy H. Nguyen and Jinyin Chen and Isao Echizen},
  journal= {arXiv preprint arXiv:2604.04473},
  year   = {2026}
}

备注

Accepted to ICPR 2026