中文

FrontierFinance:面向实际金融任务的长期人类基准

计算与语言 2026-04-08 v1

摘要

随着 AI 驱动劳动力置换日益引发担忧,现有基准测试未能衡量那些定义实际专业技能的任务。金融领域尤其具有高 AI 暴露风险,却缺乏追踪实际发展的稳健基准。当前大语言模型部署缺乏明确的问责机制,加剧了这一局限。为此,我们引入 FrontierFinance——一个包含 25 个复杂金融建模任务的长期人类基准,覆盖五大核心金融模型,平均每个任务耗时超过 18 小时。该基准由金融专业人士参与开发,反映行业标准的金融建模工作流程,并配有详细的结构化评估要素。我们邀请人类专家定义任务、创建评估要素、对大语言模型进行评分,并以人类基线完成这些任务。我们展示表明,人类专家平均得分更高,且更可能提供客户就绪的输出。

关键词

引用

@article{arxiv.2604.05912,
  title  = {FrontierFinance: A Long-Horizon Computer-Use Benchmark of Real-World Financial Tasks},
  author = {Michael Krumdick and Varshini Reddy and Shivani Chaudhary and William Day and Maarij Ahmed and Hayan Haqqi and Muhammad Ahsen Fahim and Hanzallah Amjad and Ahmad Orakzai and Aqsa Gul and Chris Tanner},
  journal= {arXiv preprint arXiv:2604.05912},
  year   = {2026}
}