质视觉问答稳定性的质疑
机器学习
2025-11-17 v1
摘要
视觉语言模型(VLMs)取得了显著进展,但其在小幅意义保持的输入变化下的可靠性仍不被充分理解。我们进行首次大规模、系统性研究,考察VLMs对良性视觉和文本扰动的鲁棒性:像素级位移、轻微几何变换、填充缩放、改写和多语言改写,这些扰动不改变图像-问题对的底层语义。我们在广泛的模型和数据集上进行实验,发现现代VLMs对此类微小扰动极其敏感:在至少一种视觉或文本修改下,相当比例的样本会改变其预测答案。我们描述了这种不稳定性在扰动类型、问题类别和模型之间的变异情况,揭示即使是最先进的系统(如GPT-4o、Gemini 2.0 Flash)在仅几像素或无害改写的情况下也经常失败。我们进一步表明,样本级稳定性是正确性的强指示器:稳定的样本在被正确回答的概率要高得多。基于此,我们演示了小型可访问开源模型的稳定性模式可用于高精度预测大型封闭源模型的正确性。我们的发现暴露了当前VLMs的根本脆弱性,并突出了需要超越对抗性扰动的鲁棒性评估,关注模型应可靠维持的不变性。
引用
@article{arxiv.2511.11208,
title = {When to Stop Federated Learning: Zero-Shot Generation of Synthetic Validation Data with Generative AI for Early Stopping},
author = {Youngjoon Lee and Hyukjoon Lee and Jinu Gong and Yang Cao and Joonhyuk Kang},
journal= {arXiv preprint arXiv:2511.11208},
year = {2025}
}
备注
Accepted to IEEE BigData 2025