中文

幻觉 VQA:在视觉幻觉上基准测试与增强多模态模型

计算机视觉与模式识别 2024-12-12 v1 计算与语言

摘要

近年来,视觉问答(VQA)取得了显著进展,特别是随着整合视觉与语言理解的多模态模型的出现。然而,现有的 VQA 数据集往往忽略了图像幻觉引入的复杂性,这对人类感知和模型解释都构成了独特挑战。在本研究中,我们引入了一个名为幻觉 VQA 的新任务,以及四个专门的数据集:IllusionMNIST、IllusionFashionMNIST、IllusionAnimals 和 IllusionChar。这些数据集旨在评估最先进的多模态模型在识别和解释视觉幻觉方面的性能。我们评估了各种模型的零样本性能,对选定模型进行了微调,并提出了一种利用高斯和模糊低通滤波器进行幻觉检测的简单而有效的解决方案。我们证明该方法显著提升了模型性能,在 IllusionAnimals 数据集上,BLIP-2 在无需任何微调的情况下表现超过了人类。我们的发现揭示了人类与模型对幻觉感知的差异,并表明微调和特定预处理技术可以显著增强模型的鲁棒性。本工作为多模态模型中更类人的视觉理解的发展做出了贡献,并提出了利用可学习参数适配滤波器的未来方向。

关键词

引用

@article{arxiv.2412.08169,
  title  = {Illusory VQA: Benchmarking and Enhancing Multimodal Models on Visual Illusions},
  author = {Mohammadmostafa Rostamkhani and Baktash Ansari and Hoorieh Sabzevari and Farzan Rahmani and Sauleh Eetemadi},
  journal= {arXiv preprint arXiv:2412.08169},
  year   = {2024}
}