中文

FLAME:金融大型语言模型评估与指标评估

计算与语言 2025-01-14 v1 人工智能 计算工程、金融与科学

摘要

大型语言模型(LLM)已彻底变革了自然语言处理领域,并在众多领域展现出巨大潜力。越来越多的金融专用大型语言模型被应用于金融领域的具体任务,但对其价值进行全面评估仍具有挑战性。本文介绍了FLAME——一个综合性的金融大型语言模型评估系统,专注于中文场景,包括两个核心评估基准:FLAME-Cer和FLAME-Sce。FLAME-Cer涵盖14种权威金融认证,包括CPA、CFA和FRM,共选取约16,000个精选题目,所有题目均经过人工审核,确保准确性和代表性。FLAME-Sce包含10个主要金融业务场景、21个次要金融业务场景,以及近100个第三层金融应用任务的综合评估集合。我们评估了6个代表性大型语言模型,包括GPT-4o、GLM-4、ERNIE-4.0、Qwen2.5、XuanYuan3以及最新的Baichuan4-Finance,结果显示Baichuan4-Finance在大多数任务中均优于其他模型。通过建立一个全面且专业的评估体系,FLAME促进了中文语境下金融大型语言模型的发展。评估参与指南已发布在GitHub上:https://github.com/FLAME-ruc/FLAME。

关键词

引用

@article{arxiv.2501.06211,
  title  = {FLAME: Financial Large-Language Model Assessment and Metrics Evaluation},
  author = {Jiayu Guo and Yu Guo and Martha Li and Songtao Tan},
  journal= {arXiv preprint arXiv:2501.06211},
  year   = {2025}
}