中文

大语言模型在印度尼西亚仅能通过小学考试:基于 IndoMMLU 的综合测试

计算与语言 2023-10-24 v2

摘要

尽管大语言模型(LLMs)常在大规模多语言文本上预训练,其推理能力与真实世界知识主要基于英文数据集评估。超越英语评估 LLM 能力日益重要,但因缺乏合适数据集而受阻。本工作中,我们推出 IndoMMLU,首个面向印度尼西亚文化与语言的多任务语言理解基准,其包含从印尼小学至大学入学考试的题目。通过聘请专业教师,我们获得跨 64 项任务与教育层级的 14,981 道题,其中 46% 聚焦于评估印尼语熟练度及印尼九种本地语言与文化的知识。我们的实证评估显示,GPT-3.5 仅能通过印尼小学水平,对本地印尼语言与文化知识有限。其他较小模型如 BLOOMZ 与 Falcon 表现更差。

关键词

引用

@article{arxiv.2310.04928,
  title  = {Large Language Models Only Pass Primary School Exams in Indonesia: A Comprehensive Test on IndoMMLU},
  author = {Fajri Koto and Nurul Aisyah and Haonan Li and Timothy Baldwin},
  journal= {arXiv preprint arXiv:2310.04928},
  year   = {2023}
}

备注

Accepted at EMNLP 2023