中文

波斯语大型语言模型的基准测试:聚焦ChatGPT的初步研究

计算与语言 2024-04-04 v1 机器学习

摘要

本文探讨了大型语言模型(LLM)在波斯语上的有效性。尽管ChatGPT及其后续LLM在英语上表现出色,但它们在更多低资源语言上的效率仍然是一个悬而未决的问题。我们首次对LLM在多种波斯语任务上进行了全面的基准测试研究。我们的主要焦点是GPT-3.5-turbo,但也包括GPT-4和OpenChat-3.5以提供更全面的评估。我们的评估涵盖了一系列不同类别的任务,包括经典、推理和基于知识的领域。为了进行彻底比较,我们将LLM与现有的任务特定微调模型进行了对比。鉴于推理任务的波斯语数据集有限,我们引入了两个新的基准:一个基于小学数学问题,另一个来自七年级和十年级的入学考试。我们的发现表明,尽管LLM(尤其是GPT-4)在需要推理能力和广泛常识理解的任务中表现出色,但它们通常落后于针对特定任务微调的较小预训练模型。此外,我们观察到,在将测试集翻译成英语后再输入GPT-3.5时,性能有所提升。这些结果突显了在波斯语中提升LLM性能的巨大潜力。由于波斯语的独特属性(包括其独特的字母和书写风格),这一点尤其值得注意。

关键词

引用

@article{arxiv.2404.02403,
  title  = {Benchmarking Large Language Models for Persian: A Preliminary Study Focusing on ChatGPT},
  author = {Amirhossein Abaskohi and Sara Baruni and Mostafa Masoudi and Nesa Abbasi and Mohammad Hadi Babalou and Ali Edalat and Sepehr Kamahi and Samin Mahdizadeh Sani and Nikoo Naghavian and Danial Namazifard and Pouya Sadeghi and Yadollah Yaghoobzadeh},
  journal= {arXiv preprint arXiv:2404.02403},
  year   = {2024}
}

备注

14 pages, 1 figure, 6 tables, Proceeding of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING)