中文

Document Haystacks:对 1000+ 文档进行视觉语言推理

计算机视觉与模式识别 2024-12-09 v3 人工智能

摘要

大型多模态模型 (LMM) 在视觉语言理解方面取得了显著进展,但在实际应用中面临限制,尤其是当需要对大量图像进行复杂推理时。现有针对多图像问答的基准测试范围有限,每个问题仅配备最多 30 张图像,无法完全捕捉大规模检索任务的需求。为缩小这一差距,我们提出两种 document haystack 基准测试,分别称为 DocHaystack 和 InfoHaystack,旨在评估 LMM 在大规模视觉文档检索和理解方面的性能。此外,我们提出了 V-RAG,一种新颖的 vision-centric 检索增强生成 (RAG) 框架,利用一套针对不同优势优化的多模态视觉编码器,以及专门的 question-document 相关性模块。V-RAG 在 DocHaystack-1000 和 InfoHaystack-1000 两个具有挑战性的基准测试中,分别比之前最佳基线模型在 Recall@1 上提升了 9% 和 11%。此外,将 V-RAG 与 LMM 集成后,使其能够高效地跨越数千张图像,显著提升了我们在 DocHaystack 和 InfoHaystack 基准测试上的表现。我们的代码和数据集已公开于 https://github.com/Vision-CAIR/dochaystacks。

关键词

引用

@article{arxiv.2411.16740,
  title  = {Document Haystacks: Vision-Language Reasoning Over Piles of 1000+ Documents},
  author = {Jun Chen and Dannong Xu and Junjie Fei and Chun-Mei Feng and Mohamed Elhoseiny},
  journal= {arXiv preprint arXiv:2411.16740},
  year   = {2024}
}

备注

the correct arxiv version