中文

预训练的视觉与语言模型能回答视觉信息检索问题吗?

计算机视觉与模式识别 2023-10-18 v5 人工智能 计算与语言

摘要

预训练的视觉与语言模型已在涉及图像与文本的现有任务(包括视觉问答)上展现出最先进的能力。然而,这些模型是否具备回答不仅查询视觉内容、而且具有知识密集与信息检索性质的问题的能力,仍不明确。在本研究中,我们引入 InfoSeek,一个专为无法仅用常识知识回答的信息检索型问题定制的视觉问答数据集。利用 InfoSeek,我们分析了多种预训练视觉问答模型并洞察其特性。我们的发现表明,最先进的预训练多模态模型(如 PaLI-X、BLIP2 等)在回答视觉信息检索问题时面临挑战,但在 InfoSeek 数据集上微调能引导模型使用其预训练期间学到的细粒度知识。此外,我们展示了准确的视觉实体识别可用于通过检索相关文档来提升 InfoSeek 上的性能,显示出显著的改进空间。

关键词

引用

@article{arxiv.2302.11713,
  title  = {Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?},
  author = {Yang Chen and Hexiang Hu and Yi Luan and Haitian Sun and Soravit Changpinyo and Alan Ritter and Ming-Wei Chang},
  journal= {arXiv preprint arXiv:2302.11713},
  year   = {2023}
}

备注

EMNLP 2023 (main conference); Our dataset and evaluation is available at https://open-vision-language.github.io/infoseek/