中文

FarsEval-PKBETS:用于评估波斯语大型语言模型的全新多样化基准

计算与语言 2025-04-22 v1 人工智能

摘要

关于评估和分析大型语言模型 (LLM) 的研究在资源丰富的语言(如英语)方面已相当广泛,但对于诸如波斯语等语言的模型性能关注 considerably有限。本文介绍FarsEval-PKBETS基准,这是FarsEval项目的一个子集,用于评估波斯语大型语言模型。该基准包含4000个问题和答案,格式包括多选、简答和描述性回答。涵盖医学、法律、宗教、波斯语、百科全书知识、人类偏好、社交知识、伦理与偏见、文本生成以及尊重他人权利等多个领域和任务。该基准融合了与波斯语及伊朗相关的语言学、文化和本地化考量。为确保问题对当前 LLM 来说具有挑战性,评估了Llama3-70B、PersianMind和Dorna三个模型。其平均准确率低于50%,意味着它们对不到一半的问题提供了完全正确的答案。这些结果表明,当前语言模型距离能够解决此基准仍有很大距离。

关键词

引用

@article{arxiv.2504.14690,
  title  = {FarsEval-PKBETS: A new diverse benchmark for evaluating Persian large language models},
  author = {Mehrnoush Shamsfard and Zahra Saaberi and Mostafa Karimi manesh and Seyed Mohammad Hossein Hashemi and Zahra Vatankhah and Motahareh Ramezani and Niki Pourazin and Tara Zare and Maryam Azimi and Sarina Chitsaz and Sama Khoraminejad and Morteza Mahdavi Mortazavi and Mohammad Mahdi Chizari and Sahar Maleki and Seyed Soroush Majd and Mostafa Masumi and Sayed Ali Musavi Khoeini and Amir Mohseni and Sogol Alipour},
  journal= {arXiv preprint arXiv:2504.14690},
  year   = {2025}
}

备注

24 pages, 3 figures, 3 tables