中文

通用模型与专用模型:评估 Urdu 语言的大型语言模型

计算与语言 2024-10-04 v3

摘要

本文比较通用模型 GPT-4-Turbo 和 Llama-3-8b 与专用模型——XLM-Roberta-large、mT5-large 和 Llama-3-8b——后者针对特定任务进行了微调。我们聚焦于七个分类任务和七个生成任务,对这些模型在 Urdu 语言上的性能进行评估。Urdu 拥有 7000 万 native 说话者,但在自然语言处理(NLP)领域仍不受到关注。尽管大型语言模型(LLM)频繁进步,但其在低资源语言(包括 Urdu)上的表现仍需进一步探索。我们还对生成任务进行人类评估,并将结果与 GPT-4-Turbo、Llama-3-8b 和 Claude 3.5 Sonnet 的评估进行比较。我们发现,针对各种任务,专用模型始终优于通用模型。我们也发现,GPT-4-Turbo 对生成任务的评估与人类评估的一致性更高。本文为 NLP 社区提供了关于通用和特定目的 LLM 在低资源语言中有效性的见解。

关键词

引用

@article{arxiv.2407.04459,
  title  = {Generalists vs. Specialists: Evaluating Large Language Models for Urdu},
  author = {Samee Arif and Abdul Hameed Azeemi and Agha Ali Raza and Awais Athar},
  journal= {arXiv preprint arXiv:2407.04459},
  year   = {2024}
}