中文

CFinBench:面向大语言模型的综合中文金融基准

计算与语言 2024-07-03 v1

摘要

大语言模型 (LLM) 在各种 NLP 任务上已取得显著成绩,但其在更具挑战性和领域特定任务(如金融)中的潜力尚未得到充分探索。本文提出 CFinBench:目前为止最精心构建的、最全面的评估基准,用于评估 LLM 在中文语境下的金融知识。实际情况下,我们构建了从 4 个一级类别的系统评估:(1) 金融学科:LLM 是否能够记住金融学科(如经济学、统计学和审计)所需的基本知识。(2) 金融资格:LLM 是否能够获得所需的金融资格认证,如注册会计师、证券资格和银行资格。(3) 金融实践:LLM 是否能够履行实际的金融工作,如税务顾问、初级会计师和证券分析师。(4) 金融法律:LLM 是否能够满足金融法律法规的要求,如税法、保险法和经济法。CFinBench 包含 99,100 题,覆盖 43 个二级类别,包含 3 种问题类型:单选、多选和判断。我们在 CFinBench 上对 50 个代表性 LLM 进行了广泛实验,各种模型规模。结果显示,GPT4 和一些面向中文的模型领先本基准,最高平均准确率为 60.16%,凸显了 CFinBench 提供的挑战。该数据集和评估代码均可在 https://cfinbench.github.io/ 获取。

关键词

引用

@article{arxiv.2407.02301,
  title  = {CFinBench: A Comprehensive Chinese Financial Benchmark for Large Language Models},
  author = {Ying Nie and Binwei Yan and Tianyu Guo and Hao Liu and Haoyu Wang and Wei He and Binfan Zheng and Weihao Wang and Qiang Li and Weijian Sun and Yunhe Wang and Dacheng Tao},
  journal= {arXiv preprint arXiv:2407.02301},
  year   = {2024}
}