Alpha Excel基准测试
机器学习
2025-05-09 v1 计算与语言
摘要
本研究提出了一个新颖的基准测试,用于评估大型语言模型(LLM),该基准使用源自金融建模世界杯(FMWC)Excel竞赛的挑战任务。我们引入了一种将113个现有FMWC挑战转换为可编程评估的JSON格式的方法,并利用该数据集比较了多个领先LLM的性能。我们的发现表明,不同挑战类别间的性能差异显著,模型在模式识别任务上展现出特定优势,但在复杂数值推理方面表现挣扎。该基准提供了一个标准化框架,用于评估LLM在现实商业导向任务而非抽象学术问题上的能力。本研究为日益发展的人工智能基准测试领域做出了贡献,将全球15亿日常使用Microsoft Excel用户的熟练程度确立为一个有意义的评估指标,从而弥合了学术AI基准与实际商业应用之间的差距。
引用
@article{arxiv.2505.04110,
title = {Alpha Excel Benchmark},
author = {David Noever and Forrest McKee},
journal= {arXiv preprint arXiv:2505.04110},
year = {2025}
}