中文

BizFinBench:面向大语言模型评估的业务驱动真实世界金融基准

人工智能 2025-05-27 v1 计算工程、金融与科学 计算与语言

摘要

大语言模型在通用任务中表现出色,但评估其在金融、法律和医疗等重逻辑、高精度领域的可靠性仍具挑战。为此,我们引入 BizFinBench,这是首个专门设计用于评估 LLM 在真实世界金融应用中表现的基准。BizFinBench 包含 6,781 个中文精标注查询,涵盖五个维度:数值计算、推理、信息抽取、预测识别和知识问答,分为九个细粒度类别。该基准包含客观和主观指标。我们还引入了 IteraJudge,一种新颖的 LLM 评估方法,可减少 LLM 在客观指标中作为评估者时的偏差。我们对 25 个模型进行了基准测试,包括专有和开源系统。大量实验表明,没有模型在所有任务上均占优势。我们的评估揭示了明显的能力模式:(1) 在数值计算中,Claude-3.5-Sonnet (63.18) 和 DeepSeek-R1 (64.04) 领先,而较小模型如 Qwen2.5-VL-3B (15.92) 显著落后;(2) 在推理中,专有模型占主导地位(ChatGPT-o3: 83.58, Gemini-2.0-Flash: 81.15),开源模型最多落后 19.49 分;(3) 在信息抽取中,性能差异最大,DeepSeek-R1 得分为 71.46,而 Qwen3-1.7B 得分为 11.23;(4) 在预测识别中,性能方差最小,顶级模型得分在 39.16 到 50.00 之间。我们发现,尽管当前 LLM 能胜任常规金融查询,但在需要跨概念推理的复杂场景中仍显吃力。BizFinBench 为未来研究提供了一个严格的、与业务对齐的基准。代码和数据集可在 https://github.com/HiThink-Research/BizFinBench 获取。

关键词

引用

@article{arxiv.2505.19457,
  title  = {BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs},
  author = {Guilong Lu and Xuntao Guo and Rongjunchen Zhang and Wenqiao Zhu and Ji Liu},
  journal= {arXiv preprint arXiv:2505.19457},
  year   = {2025}
}

备注

Project Page: https://hithink-research.github.io/BizFinBench/