中文

面向基础模型的改进繁体中文评估套件

计算与语言 2024-07-12 v3

摘要

我们提出了TMMLU+,一个专为繁体中文语言理解设计的新基准。TMMLU+是一个多项选择问答数据集,包含从初级到专业水平的66个科目。其规模是前身台湾大规模多任务语言理解(TMMLU)的六倍,且科目分布更加均衡。我们在提出的TMMLU+上对闭源模型和26个参数范围从1.8B到72B的开源中文大语言模型(LLM)进行了基准测试。我们的发现表明:(1)繁体中文模型仍落后于简体中文模型,凸显了针对繁体中文的LLM需要更专注的进步。(2)当前LLM在平均分数上仍不及人类表现,表明未来研究可能需要更深入地探索社会科学和人文学科。(3)在所有检查的分词压缩指标中,我们仅发现生育率分数与我们的基准结果表现出强相关性。我们预计TMMLU+将指明未来模型改进的方向,从而缩小机器与人类语言能力之间的差距,并支持研究人员开发繁体中文LLM。我们的数据集以及基准源代码可在huggingface.co/datasets/ikala/tmmluplus获取。

关键词

引用

@article{arxiv.2403.01858,
  title  = {An Improved Traditional Chinese Evaluation Suite for Foundation Model},
  author = {Zhi-Rui Tam and Ya-Ting Pai and Yen-Wei Lee and Jun-Da Chen and Wei-Min Chu and Sega Cheng and Hong-Han Shuai},
  journal= {arXiv preprint arXiv:2403.01858},
  year   = {2024}
}