BankerToolBench:面向终端投资银行工作流程评估 AI 代理
人工智能
2026-04-14 v1
摘要
现有的 AI 基准缺乏足够忠实度来评估专业工作流程中经济上有意义的进展。为评估高价值、耗时的职业领域中的前沿 AI 代理,我们引入 BankerToolBench (BTB):一个开源的终端分析工作流程基准,常被初级投资银行家执行。为开发建立在代表性工作环境中的生态有效基准,我们与来自领先机构的502名投资银行家合作。BTB要求代理人通过数据室、使用行业工具 (市场数据平台、SEC 公开文件数据库) 并生成多文件交付物——包括 Excel 财务模型、PPT 演示稿和 PDF/Word 报告。完成 BTB 任务最多需要21小时,凸显成功将此工作委托给 AI 的经济价值。BTB实现对任何 LLM 或代理人的自动化评估,通过100+项评级标准对交付物进行打分,这些标准由资深投资银行家定义,用于捕捉利益相关者效用。测试9个前沿模型后,我们发现即使表现最好的模型 (GPT-5.4) 也几乎未能通过一半的评级标准,且投资银行家对其输出0%认为是客户就绪状态。我们的失败分析揭示了关键障碍(如跨文件一致性失效)以及面向代理式 AI 在高风险专业工作流程中的改进方向。
引用
@article{arxiv.2604.11304,
title = {BankerToolBench: Evaluating AI Agents in End-to-End Investment Banking Workflows},
author = {Elaine Lau and Markus Dücker and Ronak Chaudhary and Hui Wen Goh and Rosemary Wei and Vaibhav Kumar and Saed Qunbar and Guram Gogia and Yi Liu and Scott Millslagle and Nasim Borazjanizadeh and Ulyana Tkachenko and Samuel Eshun Danquah and Collin Schweiker and Vijay Karumathil and Asrith Devalaraju and Varsha Sandadi and Haemi Nam and Punit Arani and Ray Epps and Abdullah Arif and Sahil Bhaiwala and Curtis Northcutt and Skyler Wang and Anish Athalye and Jonas Mueller and Francisco Guzmán},
journal= {arXiv preprint arXiv:2604.11304},
year = {2026}
}