OfficeQA Pro:面向企业级端到端 grounded 推理的基准测试
人工智能
2026-03-10 v1 计算与语言
信息检索
摘要
我们介绍 OfficeQA Pro,这是一个用于评估 AI 智能体在大规模异构文档语料库上进行 grounded、多文档推理能力的基准测试。该语料库包含跨近 100 年的美国财政部公告,涵盖 89,000 页内容和超过 2600 万个数值。OfficeQA Pro 包含 133 个问题,要求模型进行精准的文档解析、检索与分析推理,涉及结构化文本和表格数据。包括 Claude Opus 4.6、GPT-5.4 和 Gemini 3.1 Pro Preview 等前沿大语言模型在内的模型,在仅依赖参数化知识的情况下在 OfficeQA Pro 上的准确率不足 5%,若额外访问网络资源,准确率仍不足 12%。当直接获取文档语料库后,前沿智能体仍在超过半数的题目上挣扎,平均得分仅为 34.1%。我们发现,为模型提供由 Databricks 的 ai_parse_document 生成的结构化文档表示,可在模型间实现 16.1% 的平均相对性能提升。我们进一步进行了若干消融实验,以研究模型选择、表格表示、检索策略以及推理规模对性能的影响。尽管有了这些改进,在智能体能够被视为可靠的企业级 grounded 推理能力方面,仍有显著的提升空间。
引用
@article{arxiv.2603.08655,
title = {OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning},
author = {Krista Opsahl-Ong and Arnav Singhvi and Jasmine Collins and Ivan Zhou and Cindy Wang and Ashutosh Baheti and Owen Oertell and Jacob Portes and Sam Havens and Erich Elsen and Michael Bendersky and Matei Zaharia and Xing Chen},
journal= {arXiv preprint arXiv:2603.08655},
year = {2026}
}
备注
24 pages, 16 figures. Introduces the OfficeQA Pro benchmark for grounded reasoning over enterprise documents