Finch:面向以电子表格为中心的企业工作流的金融与会计基准测试
人工智能
2026-04-17 v5 计算工程、金融与科学
信息检索
多智能体系统
摘要
我们提出了 FinWorkBench(又称 Finch),用于评估 AI 智能体在真实世界、企业级金融与会计工作流上的表现,这些工作流交织了数据录入、结构化、格式化、网页搜索、跨文件检索、计算、建模、验证、翻译、可视化和报告等任务。Finch 的数据来源于 Enron(15,000 个文件和 500,000 封邮件)及其他金融机构的真实企业工作空间,覆盖 2000 年至 2025 年,保留了跨预算、交易、资产管理及运营管理等多个领域多模态 artifacts(如表格和图表)在真实场景中的杂乱特性。我们提出了一种工作流构建流程,将大语言模型辅助的真实企业环境工作流挖掘与专家标注相结合:(1)利用大语言模型辅助、专家验证的真实邮件线程和电子表格版本历史推导工作流,(2)需要超过 700 小时专家投入的细致标注。这产生了 172 个复合工作流,包含 384 个任务,涉及 1,710 个电子表格和 2,700 万个单元格,以及 PDF 和其他 artifacts,捕捉了真实企业工作内在的杂乱性、长周期性、知识密集性和协作性。我们对前沿 AI 系统(包括 GPT-5.1、Claude Sonnet 4.5、Claude Opus 4.5、Gemini 3 Pro、Grok 4 和 Qwen 3 Max)进行了人工和自动化评估。在人工评估中,GPT-5.1 Pro 平均每个工作流花费 16.8 分钟,但仅通过了 38.4% 的工作流。全面的案例研究进一步揭示了真实企业工作流对 AI 智能体构成的挑战。
引用
@article{arxiv.2512.13168,
title = {Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows},
author = {Haoyu Dong and Pengkun Zhang and Yan Gao and Xuanyu Dong and Yilin Cheng and Mingzhe Lu and Zikun Zhu and Adina Yakefu and Shuxin Zheng},
journal= {arXiv preprint arXiv:2512.13168},
year = {2026}
}
备注
ACL 2026 Findings