噪声条件下视觉语言模型的鲁棒性评估
计算机视觉与模式识别
2025-09-17 v1
摘要
视觉语言模型在图像描述和视觉问答等多模态任务中取得了卓越的成功。然而,它们在噪声条件下的鲁棒性仍不为人所知。在本研究中,我们提出了一个全面的评估框架,以评估几种SOTA VLM在受控扰动下的性能,包括光照变化、运动模糊和压缩伪影。我们使用了基于词汇的指标(BLEU、METEOR、ROUGE、CIDEr)以及基于神经网络的相似度度量(使用句子嵌入)来量化语义对齐。我们的实验跨越多个数据集,揭示了关键见解:(1)真实描述的描述性显著影响模型性能;(2)LLaVA等较大模型在语义理解方面表现出色,但并未普遍优于较小模型;(3)某些噪声类型(如JPEG压缩和运动模糊)会显著降低各模型的性能。我们的发现突出了模型大小、数据集特征与噪声抗性之间的细微权衡,为未来的鲁棒多模态学习提供了标准化基准。
引用
@article{arxiv.2509.12492,
title = {Evaluating Robustness of Vision-Language Models Under Noisy Conditions},
author = {Purushoth and Alireza},
journal= {arXiv preprint arXiv:2509.12492},
year = {2025}
}