通用模型与专用模型:评估 Urdu 语言的大型语言模型
计算与语言
2024-10-04 v3
摘要
本文比较通用模型 GPT-4-Turbo 和 Llama-3-8b 与专用模型——XLM-Roberta-large、mT5-large 和 Llama-3-8b——后者针对特定任务进行了微调。我们聚焦于七个分类任务和七个生成任务,对这些模型在 Urdu 语言上的性能进行评估。Urdu 拥有 7000 万 native 说话者,但在自然语言处理(NLP)领域仍不受到关注。尽管大型语言模型(LLM)频繁进步,但其在低资源语言(包括 Urdu)上的表现仍需进一步探索。我们还对生成任务进行人类评估,并将结果与 GPT-4-Turbo、Llama-3-8b 和 Claude 3.5 Sonnet 的评估进行比较。我们发现,针对各种任务,专用模型始终优于通用模型。我们也发现,GPT-4-Turbo 对生成任务的评估与人类评估的一致性更高。本文为 NLP 社区提供了关于通用和特定目的 LLM 在低资源语言中有效性的见解。
引用
@article{arxiv.2407.04459,
title = {Generalists vs. Specialists: Evaluating Large Language Models for Urdu},
author = {Samee Arif and Abdul Hameed Azeemi and Agha Ali Raza and Awais Athar},
journal= {arXiv preprint arXiv:2407.04459},
year = {2024}
}