多模态语言模型对干扰项的鲁棒性研究
计算机视觉与模式识别
2025-02-17 v1
摘要
尽管视觉语言模型 (VLM) 在诸多应用场景如视觉问答中取得了显著进展,但其对提示变异的鲁棒性仍属未充分探索的领域。了解干扰项如何影响 VLM 对于提高其实际应用性意义重大,因为在许多实际场景中,输入可能包含噪声和无关信息。本文旨在评估 VLM 在科学问答情境下针对视觉与文本干扰项的鲁棒性。基于 ScienceQA 数据集,我们构建了新的基准测试,在视觉与文本语境中引入干扰项,以评估 VLM 在此类干扰下的推理能力。我们的发现表明,绝大多数前沿 VLM,包括 GPT-4,都对各种类型的干扰项十分敏感,在面对干扰时会出现显著的推理能力下降。值得注意的是,像 InternVL2 这类模型对这些干扰项的鲁棒性较高。我们还发现模型对文本干扰项的敏感性高于视觉干扰项。此外,我们还探讨了 various 缓解策略,如提示工程,以抵消干扰的影响。尽管这些策略改善了解答准确率,但我们的分析显示仍存在显著的改进空间。
引用
@article{arxiv.2502.09818,
title = {On the robustness of multimodal language model towards distractions},
author = {Ming Liu and Hao Chen and Jindong Wang and Wensheng Zhang},
journal= {arXiv preprint arXiv:2502.09818},
year = {2025}
}