中文

面向波斯语的开源大语言模型基准测试:零-shot 与 few-shot 学习

计算与语言 2025-10-16 v1 人工智能

摘要

大语言模型 (LLMs) 在诸多语言上展现出惊人的能力; 然而,其在资源匮乏的语言(如波斯语)中的效果仍需深入调查。本文提供了一套针对波斯语自然语言处理 (NLP) 任务的全面基准测试,评估多种开源 LLMs,采用零-shot 与 few-shot 学习范式。我们在情感分析、命名实体识别、阅读理解和问答等任务上进行评估,采用 ParsiNLU 和 ArmanEmo 等既定波斯语数据集。我们的方法论包括严格的零-shot 与 few-shot 实验设置,采用准确率、F1 分数、BLEU 和 ROUGE 等指标进行性能评估。结果显示,Gemma 2 在两大学习范式中几乎所有任务上均表现优异,尤其在复杂推理任务中表现突出。然而,大多数模型在词汇级理解任务(如命名实体识别)方面仍表现不足,这凸显了波斯语语言处理中的具体挑战。该研究为多语言 LLMs 的研究提供了宝贵见解,为未来模型发展提供了波斯语基准测试。

关键词

引用

@article{arxiv.2510.12807,
  title  = {Benchmarking Open-Source Large Language Models for Persian in Zero-Shot and Few-Shot Learning},
  author = {Mahdi Cherakhloo and Arash Abbasi and Mohammad Saeid Sarafraz and Bijan Vosoughi Vahdat},
  journal= {arXiv preprint arXiv:2510.12807},
  year   = {2025}
}