中文

Khayyam Challenge (PersianMMLU):你的 LLM 真正精通波斯语吗?

计算与语言 2024-04-11 v1 人工智能

摘要

评估大型语言模型(LLM)因其生成特性而极具挑战性,需要精确的评估方法。此外,非英语 LLM 的评估落后于英语,导致许多语言缺乏或仅有性能薄弱的 LLM。针对这一需求,我们引入了 Khayyam Challenge(亦称 PersianMMLU),这是一个精心策划的集合,包含 20,192 道四选一问题,源自从波斯语考试中提取的 38 项多样化任务,涵盖了广泛的学科、复杂度和年龄段。Khayyam Challenge 的主要目标是促进对支持波斯语的 LLM 的严格评估。Khayyam Challenge 的显著特征是: 包含对各种主题的全面覆盖,如文学理解、数学、科学、逻辑、智力测试等,旨在评估 LLM 的不同侧面,如从小学低年级到高中阶段各个教育阶段的语言理解、推理和信息检索能力; 包含丰富的元数据,如人类回答率、难度级别和描述性答案; 使用新数据以避免现有框架中普遍存在的数据污染问题; 使用专为波斯语使用者量身定制的原始非翻译数据,确保该框架免受翻译挑战和错误的影响,同时包含文化细微差别; 具有固有的可扩展性,可在无需特殊人力的情况下进行未来的数据更新和评估。以往的研究缺乏一个将所有这些特征结合在一个综合基准中的评估框架。此外,我们评估了支持波斯语的多种现有 LLM,并对其输出进行了统计分析和解释。

关键词

引用

@article{arxiv.2404.06644,
  title  = {Khayyam Challenge (PersianMMLU): Is Your LLM Truly Wise to The Persian Language?},
  author = {Omid Ghahroodi and Marzia Nouri and Mohammad Vali Sanian and Alireza Sahebi and Doratossadat Dastgheib and Ehsaneddin Asgari and Mahdieh Soleymani Baghshah and Mohammad Hossein Rohban},
  journal= {arXiv preprint arXiv:2404.06644},
  year   = {2024}
}