中文

UNK-VQA:一个数据集及对多模态大模型拒答能力的探查

计算机视觉与模式识别 2024-08-22 v6

摘要

教导视觉问答(VQA)模型对无法回答的问题拒答,是构建可信赖 AI 系统的必要环节。现有研究虽已探索 VQA 的多个方面,却在一定程度上忽视了这一特定属性。本文旨在通过贡献一个名为 UNK-VQA 的综合数据集来弥补这一研究空白。该数据集专门设计用于应对模型未知问题的挑战。为此,我们首先通过对图像或问题施加刻意扰动来扩充现有数据。具体而言,我们仔细确保问题-图像语义保持接近原始的未扰动分布。借此手段,对无法回答问题的识别变得困难,使我们的数据集区别于那些仅涉及图像替换的其他数据集。随后,我们广泛评估了若干新兴多模态大模型在零样本和少样本下的表现,发现它们应用于我们的数据集时存在显著局限。此外,我们还提出了一种直接方法来处理这些无法回答的问题。我们相信,该数据集将作为提升 VQA 模型拒答能力的宝贵基准,从而增强 AI 系统的可信赖性。我们已公开该数据集(https://github.com/guoyang9/UNK-VQA)以促进该领域的进一步探索。

关键词

引用

@article{arxiv.2310.10942,
  title  = {UNK-VQA: A Dataset and a Probe into the Abstention Ability of Multi-modal Large Models},
  author = {Yangyang Guo and Fangkai Jiao and Zhiqi Shen and Liqiang Nie and Mohan Kankanhalli},
  journal= {arXiv preprint arXiv:2310.10942},
  year   = {2024}
}

备注

Accepted by TPAMI