CFLUE:中文金融语言理解评估基准
计算与语言
2024-05-20 v1 人工智能
摘要
鉴于大型语言模型 (LLM) 最近在自然语言处理 (NLP) 领域的突破,亟需新的基准测试以跟上 LLM 快速发展的步伐。本文提出 CFLUE,即中文金融语言理解评估基准,旨在评估 LLM 在多个维度上的能力。具体而言,CFLUE 提供针对知识评估和应用评估的专门数据集。知识评估方面,包含 38K+ 道多选题及其解答说明,这些问题既用于答案预测,也用于问题推理。在应用评估方面,CFLUE 包含 16K+ 测试实例,涵盖文本分类、机器翻译、关系抽取、阅读理解和文本生成等不同 NLP 任务。我们在 CFLUE 上对代表性 LLM 进行了全面评估。结果显示,只有 GPT-4 和 GPT-4-turbo 在知识评估的答案预测中准确率超过60%,表明当前 LLM 在此方面仍有很大的提升空间。在应用评估中,尽管 GPT-4 和 GPT-4-turbo 是排名前两的模型,但其在轻量级 LLM 上的优势明显减弱。CFLUE 的数据集和脚本已开放访问于 https://github.com/aliyun/cflue。
引用
@article{arxiv.2405.10542,
title = {Benchmarking Large Language Models on CFLUE -- A Chinese Financial Language Understanding Evaluation Dataset},
author = {Jie Zhu and Junhui Li and Yalong Wen and Lifan Guo},
journal= {arXiv preprint arXiv:2405.10542},
year = {2024}
}
备注
Accepted by ACL 2024