CFBenchmark:面向大语言模型的中文金融助手基准
计算与语言
2024-05-22 v2
摘要
大语言模型(LLMs)在金融领域已展现出巨大潜力。因此,评估 LLMs 在金融任务上的表现变得重要。本工作中,我们引入 CFBenchmark,用于评估 LLMs 作为中文金融助手的表现。CFBenchmark 的基础版本旨在从识别、分类和生成三个方面评估中文金融文本处理的基础能力,涵盖八项任务,并包含长度从 50 到超过 1,800 字符的金融文本。我们使用 CFBenchmark-Basic 对文献中若干可用 LLM 进行实验,实验结果表明,尽管部分 LLM 在特定任务上表现突出,但总体而言,现有模型在金融文本处理基础任务上仍有显著改进空间。未来,我们计划探索 CFBenchmark 的高级版本,旨在以中文金融助手身份在更深维度进一步探究语言模型的广泛能力。我们的代码发布于 https://github.com/TongjiFinLab/CFBenchmark。
引用
@article{arxiv.2311.05812,
title = {CFBenchmark: Chinese Financial Assistant Benchmark for Large Language Model},
author = {Yang Lei and Jiangtong Li and Dawei Cheng and Zhijun Ding and Changjun Jiang},
journal= {arXiv preprint arXiv:2311.05812},
year = {2024}
}
备注
12 pages, 4 figures