中文

KMMLU:衡量韩语的大规模多任务语言理解

计算与语言 2024-06-07 v2

摘要

我们提出了 KMMLU,这是一个新的韩语基准,包含跨越从人文学科到 STEM 的 45 个学科的 35,030 个专家级多项选择题。虽然之前的韩语基准是从现有的英语基准翻译而来的,但 KMMLU 收集自原创韩语考试,捕捉了韩语的语言和文化方面。我们测试了 27 个公开和专有 LLM,观察到最好的公开模型得分为 50.5%,留下了显著的改进空间。该模型主要针对英语和汉语进行训练,而非韩语。当前专为韩语定制的 LLM(如 Polyglot-Ko)表现要差得多。令人惊讶的是,即使是最强大的专有 LLM(例如 GPT-4 和 HyperCLOVA X)也没有超过 60%。这表明需要进一步的工作来改进韩语 LLM,我们相信 KMMLU 提供了跟踪这一进展的合适工具。我们将数据集在 Hugging Face Hub 上公开,并将该基准集成到 EleutherAI 的语言模型评估 harness 中。

关键词

引用

@article{arxiv.2402.11548,
  title  = {KMMLU: Measuring Massive Multitask Language Understanding in Korean},
  author = {Guijin Son and Hanwool Lee and Sungdong Kim and Seungone Kim and Niklas Muennighoff and Taekyoon Choi and Cheonbok Park and Kang Min Yoo and Stella Biderman},
  journal= {arXiv preprint arXiv:2402.11548},
  year   = {2024}
}

备注

Under Review