中文

ColPali:利用视觉语言模型进行高效文档检索

信息检索 2025-03-03 v6 计算与语言 计算机视觉与模式识别

摘要

文档是富有视觉结构的信息载体,通过文本之外还包含图表、页面布局、表格或字体等元素来传递信息。由于现代检索系统主要依赖从文档页面提取的文本信息进行索引——通常需要冗长且脆弱的过程——它们难以有效利用关键视觉线索。这限制了其在诸多实际文档检索应用(如检索增强生成,RAG)中的能力。为基准测试当前系统在视觉丰富文档检索方面的表现,我们引入了视觉文档检索基准 ViDoRe,包含 various page-level 检索任务,涵盖多个领域、语言和实际场景。现代系统的内在复杂性和性能不足激发了一种新概念:直接通过文档页面图像进行文档检索。我们发布 ColPali,一个训练有素质的视觉语言模型,可从文档页面图像中生成高质量的多向量嵌入。结合晚期交互匹配机制,ColPali 在文档检索管线中显著优于现代方法,同时大幅简化、加速且可端到端训练。我们在 https://hf.co/vidore 上以开放许可证发布模型、数据、代码和基准。

关键词

引用

@article{arxiv.2407.01449,
  title  = {ColPali: Efficient Document Retrieval with Vision Language Models},
  author = {Manuel Faysse and Hugues Sibille and Tony Wu and Bilel Omrani and Gautier Viaud and Céline Hudelot and Pierre Colombo},
  journal= {arXiv preprint arXiv:2407.01449},
  year   = {2025}
}

备注

Published as a conference paper at ICLR 2025