中文

ProverbEval:探索低资源语言理解的大语言模型评估挑战

计算与语言 2025-02-11 v3

摘要

随着评估数据集的快速发展,用于评估大语言模型(LLMs)在广泛主题和领域的理解能力,识别合适的语言理解基准变得越来越具有挑战性。在本工作中,我们探索了低资源语言理解的大语言模型评估挑战,并引入了 ProverbEval——一个面向低资源语言的 LLM 评估基准,专注于文化特定场景中的低资源语言理解。我们对各种 LLM 进行了基准测试,并探索了导致基准测试过程中差异的因素。我们观察到,在多项选择题中答案呈现顺序不同,性能差异可达 50%。母语谚语描述显著改善了谚语生成等任务,有助于提高结果。此外,单语评估在生成任务中始终优于其跨语言对应方法。我们认为,在创建 LLM 评估基准时,必须特别关注答案顺序、提示语言的选择、任务多样性以及生成任务。评估数据可在 https://huggingface.co/datasets/israel/ProverbEval 获取,评估代码在 https://github.com/EthioNLP/EthioProverbEval。

关键词

引用

@article{arxiv.2411.05049,
  title  = {ProverbEval: Exploring LLM Evaluation Challenges for Low-resource Language Understanding},
  author = {Israel Abebe Azime and Atnafu Lambebo Tonja and Tadesse Destaw Belay and Yonas Chanie and Bontu Fufa Balcha and Negasi Haile Abadi and Henok Biadglign Ademtew and Mulubrhan Abebe Nerea and Debela Desalegn Yadeta and Derartu Dagne Geremew and Assefa Atsbiha tesfau and Philipp Slusallek and Thamar Solorio and Dietrich Klakow},
  journal= {arXiv preprint arXiv:2411.05049},
  year   = {2025}
}