测量台湾华语语言理解
计算与语言
2024-04-01 v1
摘要
大型语言模型(LLM)的评估近来引起了广泛关注。本文聚焦于在中文语境下评估LLM,特别是针对现有基准中代表性不足的繁体中文。我们提出了TMLU,一个全面的评估套件,旨在评估LLM在台湾华语语境下的高级知识和推理能力。TMLU包含37个学科,涵盖社会科学、STEM、人文学科、台湾特定内容等,范围从中学到专业水平。此外,我们为每个学科策划了类似思维链的少样本解释,以促进复杂推理技能的评估。为了建立全面的基线,我们对24个先进的LLM进行了广泛的实验和分析。结果表明,中文开源模型的性能不如多语言专有模型,而针对台湾华语的开源模型落后于简体中文模型。这些发现表明还有很大的改进空间,并强调了TMLU的目标:促进本地化台湾华语LLM的发展。我们向社区发布基准和评估脚本,以促进未来的研究。
引用
@article{arxiv.2403.20180,
title = {Measuring Taiwanese Mandarin Language Understanding},
author = {Po-Heng Chen and Sijia Cheng and Wei-Lin Chen and Yen-Ting Lin and Yun-Nung Chen},
journal= {arXiv preprint arXiv:2403.20180},
year = {2024}
}
备注
Preprint. Under review