ViDoRe V3:复杂真实场景下检索增强生成的综合评估
人工智能
2026-04-22 v2 计算机视觉与模式识别
摘要
检索增强生成(RAG)流水线必须应对简单单文档检索之外的挑战,例如解释视觉元素(表格、图表、图像)、跨文档综合信息以及提供准确的来源依据。现有基准无法捕捉这种复杂性,往往侧重于文本数据、单文档理解,或孤立地评估检索与生成。我们引入 ViDoRe v3,一个全面的多模态 RAG 基准,包含针对视觉丰富文档语料库的多类型查询。它涵盖了跨越多个专业领域的 10 个数据集,包含约 26,000 个文档页面和 3,099 个人工验证的查询配对,每个查询均提供 6 种语言版本。通过 12,000 小时的人工标注工作,我们为检索相关性、边界框定位和已验证的参考答案提供了高质量标注。我们对 state-of-the-art RAG 流水线的评估表明,视觉检索器优于文本检索器,后期交互模型与文本重排序显著提升了性能,而混合或纯视觉上下文提升了答案生成质量。然而,当前模型在处理非文本元素、开放式查询和细粒度视觉定位方面仍存在困难。为了推动应对这些挑战的研究进展,该基准已在商业许可许可下发布于 https://hf.co/vidore。
关键词
引用
@article{arxiv.2601.08620,
title = {ViDoRe V3: A Comprehensive Evaluation of Retrieval Augmented Generation in Complex Real-World Scenarios},
author = {António Loison and Quentin Macé and Antoine Edy and Victor Xing and Tom Balough and Gabriel Moreira and Bo Liu and Manuel Faysse and Céline Hudelot and Gautier Viaud},
journal= {arXiv preprint arXiv:2601.08620},
year = {2026}
}