中文

FinEval:面向大语言模型的中文金融领域知识评测基准

计算与语言 2024-12-10 v2

摘要

大语言模型已在各种自然语言处理任务中展现出卓越性能,但其在金融领域的安全能力尚未被探索,且其在金融智能体等复杂任务上的表现仍属未知。本文提出 FinEval,一个用于评估 LLM 金融领域知识与实际能力的基准。该数据集包含 8,351 道题目,分为四个关键领域:金融学术知识、金融行业知识、金融安全知识与金融智能体。金融学术知识包含 4,661 道选择题,涵盖金融与经济学等 34 个学科。金融行业知识包含 1,434 道涉及投资研究等实际场景的题目。金融安全知识通过 1,640 道关于应用安全与密码学等主题的题目评估模型。金融智能体通过 616 道题目评估工具使用与复杂推理能力。FinEval 具有多种评测设置,包括零样本、带思维链的五样本,并采用客观与主观标准评估模型表现。我们的结果显示,在零样本设置下,Claude 3.5-Sonnet 在所有金融领域类别上取得最高的 72.9 加权平均分。我们的工作提供了一个与中文金融领域紧密契合的综合基准。

关键词

引用

@article{arxiv.2308.09975,
  title  = {FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models},
  author = {Xin Guo and Haotian Xia and Zhaowei Liu and Hanyang Cao and Zhi Yang and Zhiqiang Liu and Sizhe Wang and Jinyi Niu and Chuqi Wang and Yanhui Wang and Xiaolong Liang and Xiaoming Huang and Bing Zhu and Zhongyu Wei and Yun Chen and Weining Shen and Liwen Zhang},
  journal= {arXiv preprint arXiv:2308.09975},
  year   = {2024}
}