多模态语言模型对干扰因素的鲁棒性研究
信息论
2025-02-17 v1 math.IT
摘要
尽管视觉语言模型(VLMs)在各种应用中取得了显著进展,如视觉问答,但其对提示变体的鲁棒性仍是一个备受关注的未探索领域。理解干扰因素如何影响VLMs至关重要,因为在许多实际场景中,输入可能包含噪声和无关信息。本文旨在评估VLMs在科学问答情境下,针对视觉和文本干扰因素的鲁棒性。基于ScienceQA数据集,我们构建了一个新基准,引入视觉和文本上下文中的干扰因素,以评估VLMs在面对这些干扰时的推理能力。我们的发现表明,大多数前沿VLMs,包括GPT-4,都容易受到各种类型干扰的影响,在面对干扰时推理能力会出现明显下降。值得注意的是,InternVL2等模型对这些干扰因素的鲁棒性较高。我们还发现模型对文本干扰的敏感性高于视觉干扰。此外,我们探索了各种缓解策略,如提示工程,以抵消干扰因素的影响。虽然这些策略提高了解答准确率,但我们的分析显示,在改进方面仍存在显著的潜力。
引用
@article{arxiv.2502.09817,
title = {Vector Linear Secure Aggregation},
author = {Xihang Yuan and Hua Sun},
journal= {arXiv preprint arXiv:2502.09817},
year = {2025}
}