中文

SnapNTell:利用检索增强多模态 LLM 提升以实体为中心的视觉问答

计算机视觉与模式识别 2024-03-08 v1

摘要

视觉扩展的 LLM 在视觉问答(VQA)中取得了显著进展。尽管有这些进步,VLLM 在处理涉及长尾实体的查询时仍遇到巨大困难,倾向于产生错误或幻觉的响应。在本工作中,我们引入了一个名为 \textbf{SnapNTell} 的新型评估基准,专门针对以实体为中心的 VQA。该任务旨在测试模型识别实体并提供详细的、特定实体知识的能力。我们开发了 \textbf{SnapNTell Dataset},与传统 VQA 数据集不同:(1) 它包含广泛的分类实体,每个实体由图像表示并在答案中明确命名;(2) 它具有需要广泛知识才能准确回答的 QA 对。该数据集被组织成 22 个主要类别,共包含 7,568 个唯一实体。对于每个实体,我们精心挑选了 10 张说明性图像并制作了 10 个知识密集型 QA 对。为了解决这一新任务,我们设计了一个可扩展、高效且透明的检索增强多模态 LLM。我们的方法在 SnapNTell 数据集上显著优于现有方法,在 BELURT 分数上实现了 66.5\% 的提升。我们将很快公开该数据集和源代码。

关键词

引用

@article{arxiv.2403.04735,
  title  = {SnapNTell: Enhancing Entity-Centric Visual Question Answering with Retrieval Augmented Multimodal LLM},
  author = {Jielin Qiu and Andrea Madotto and Zhaojiang Lin and Paul A. Crook and Yifan Ethan Xu and Xin Luna Dong and Christos Faloutsos and Lei Li and Babak Damavandi and Seungwhan Moon},
  journal= {arXiv preprint arXiv:2403.04735},
  year   = {2024}
}