面向企业 AI 的复杂多模态文档处理管道基准测试:统一评估框架
计算与语言
2026-04-30 v1 人工智能
信息检索
摘要
今天的大多数企业文档 AI 都是管道式系统:解析、索引、检索、生成。每个阶段都研究得很深,但仍难以对整个系统进行评估。我们构建了 EnterpriseDocBench 来尝试解决这个问题:解析保真度、索引效率、检索相关性和生成可靠性,全部基于同一语料库。该语料库由跨六个企业领域(目前五个领域已实现)的公开、可自由使用的文档构建而成。我们将三个管道通过其进行测试——BM25、稠密嵌入和混合检索——所有管道都使用相同的 GPT-5 生成器。核心数字:混合检索略胜于 BM25(nDCG@5 为 0.92 vs. 0.91),两者都优于稠密嵌入(0.83)。幻觉并非随文档长度单调增长——短文档和非常长的文档都比中等长度文档更容易产生幻觉(分别为 28.1% 和 23.8% vs. 9.2%)。跨阶段相关性很弱:解析-检索 r=0.14,解析-生成 r=0.17,检索-生成 r=0.02。如果质量是级联式的,这些数字会更高;实际上并非如此。设计限制是真实的(解析固定、生成器共享、自动代理指标),我们不会夸大其词。一项真正令人惊讶的结果是:已声称的事实准确率为 85.5%,但答案完整性仅为 0.40。系统在回答时是正确的——只是遗漏了内容。这个差距对于实际部署的影响比 headline 准确率更大。我们还描述了三个参考架构(ColPali、ColQwen2、基于代理复杂度的路由),尚未实现端到端集成。框架、指标、基线和收集脚本将在接受后以开源方式发布。
引用
@article{arxiv.2604.26382,
title = {Benchmarking Complex Multimodal Document Processing Pipelines: A Unified Evaluation Framework for Enterprise AI},
author = {Saurabh K. Singh and Sachin Raj},
journal= {arXiv preprint arXiv:2604.26382},
year = {2026}
}
备注
16 pages, 4 tables. Code, metrics, and pilot data to be released upon publication