C$^{3}$Bench:大语言模型的经典中文理解综合基准
计算与语言
2024-05-31 v2
摘要
经典中文理解(CCU)在保存和探索卓越的传统中文文化方面具有重要价值。近期,研究者尝试利用大语言模型(LLM)的卓越理解和语义能力来实现 CCU。然而,尚无综合性基准用于评估 LLM 的 CCU 能力。为填补这一空白,本文引入 Cbench,即一个综合性经典中文理解基准,包含 50,000 条文本对,用于五个主要 CCU 任务,包括分类、检索、命名实体识别、标点和翻译。此外,Cbench 中的数据来自十个不同领域,涵盖经典中文的大多数类别。依托所提出的 Cbench,我们广泛评估了 15 个代表性 LLM 在所有五个 CCU 任务中的定量性能。我们的结果不仅建立了 LLM CCU 能力的公开排行榜,还获得了一些发现。具体而言,现有的 LLM 在 CCU 任务上表现不足,仍不及监督模型。此外,结果表明,CCU 是一个需要特别关注的任务。我们认为本研究为 LLM 基于 CCU 的未来发展提供了标准基准、全面基线和宝贵见解。评估管道和数据集已提供,链接为 \url{https://github.com/SCUT-DLVCLab/C3bench}。
引用
@article{arxiv.2405.17732,
title = {C$^{3}$Bench: A Comprehensive Classical Chinese Understanding Benchmark for Large Language Models},
author = {Jiahuan Cao and Yongxin Shi and Dezhi Peng and Yang Liu and Lianwen Jin},
journal= {arXiv preprint arXiv:2405.17732},
year = {2024}
}