中文

Golden Touchstone: 评估金融大语言模型的综合性双语基准

计算与语言 2025-12-09 v2 计算工程、金融与科学

摘要

随着大语言模型(LLMs)日益渗透到金融领域,迫切需要一种标准化的方法来全面评估其性能。现有的金融基准往往存在语言和任务覆盖范围有限、数据集质量低以及缺乏LLM评估适应性等不足。为解决这些局限性,我们引入了Golden Touchstone,这是一个面向金融LLM的综合性双语基准,涵盖中文和英文的八项核心金融自然语言处理任务。该基准基于广泛的开放数据收集和行业特定需求开发,全面评估模型的语言理解与生成能力。通过对GPT-4o、Llama3、FinGPT和FinMA等主要模型的比较分析,我们揭示了它们在处理复杂金融信息方面的优势与局限性。此外,我们开源了Touchstone-GPT,一个通过持续预训练和指令微调训练的金融LLM,该模型在双语基准上表现出色,但在特定任务上仍存在局限性。本研究为金融LLM提供了实用的评估工具,并指导未来的发展与优化。Golden Touchstone的源代码和Touchstone-GPT的模型权重已公开发布于https://github.com/IDEA-FinAI/Golden-Touchstone。

关键词

引用

@article{arxiv.2411.06272,
  title  = {Golden Touchstone: A Comprehensive Bilingual Benchmark for Evaluating Financial Large Language Models},
  author = {Xiaojun Wu and Junxi Liu and Huanyi Su and Zhouchi Lin and Yiyan Qi and Chengjin Xu and Jiajun Su and Jiajie Zhong and Fuwei Wang and Saizhuo Wang and Fengrui Hua and Jia Li and Jian Guo},
  journal= {arXiv preprint arXiv:2411.06272},
  year   = {2025}
}

备注

Published in Findings of EMNLP 2025