FIRE:面向金融智能与推理评估的全方位基准
人工智能
2026-02-27 v1 机器学习
摘要
我们提出 FIRE,一个全面的基准,用于评估大语言模型(LLM)的理论金融知识以及其处理实际商业情景的能力。对于理论评估,我们精选了来自广为人知金融资格考试的多样化考试题目,确保对 LLM 金融知识的深入理解与应用进行评估。此外,为评估 LLM 在现实金融任务中的实际价值,我们提出了一套系统化的评估矩阵,对复杂金融领域进行分类,确保覆盖关键子领域与商业活动。基于此评估矩阵,我们收集了 3000 题金融情景题目,包括带有参考答案的闭合形式决策题目与由预定义评分标准评估的开放式题目。我们对 FIRE 基准上的最新 SOTA LLM 进行了全面评估,包括我们最新的金融领域模型 XuanYuan 4.0,作为强领域内基线进行测试。这些结果使我们能够系统性地分析当前 LLM 在金融应用中的能力边界。我们公开发布基准题目及评估代码,以促进未来研究。
引用
@article{arxiv.2602.22273,
title = {FIRE: A Comprehensive Benchmark for Financial Intelligence and Reasoning Evaluation},
author = {Xiyuan Zhang and Huihang Wu and Jiayu Guo and Zhenlin Zhang and Yiwei Zhang and Liangyu Huo and Xiaoxiao Ma and Jiansong Wan and Xuewei Jiao and Yi Jing and Jian Xie},
journal= {arXiv preprint arXiv:2602.22273},
year = {2026}
}