预训练大语言模型在乌尔都语自然语言处理任务上的性能基准测试
计算与语言
2025-01-31 v2 人工智能
摘要
在多语言数据上预训练的大语言模型通过从特定语言和任务的模型流水线过渡到适应各种任务的单一模型,彻底改变了自然语言处理研究。然而,现有的大语言模型多语言自然语言处理基准测试大多只提供少数几种语言(语言多样性较低)的评估数据。此外,这些基准测试缺乏针对各自最先进模型的质量评估。本研究对 7 个著名的大语言模型(GPT-3.5-turbo、Llama 2-7B-Chat、Llama 3.1-8B、Bloomz 3B、Bloomz 7B1、Ministral-8B 和 Whisper(大、中、小变体))在零样本设置下,使用 22 个数据集、13.8 小时的语音,跨越 17 个任务进行了深入考察,并与最先进模型的性能进行了比较和分析。我们的实验表明,在零样本设置下,最先进模型目前在大多数乌尔都语自然语言处理任务中优于编码器-解码器模型。然而,比较 Llama 3.1-8B 与其先前版本 Llama 2-7B-Chat,我们可以推断,随着语言覆盖范围的改善,大语言模型可以超越这些最先进模型。我们的结果强调,在多个任务中,参数更少但语言特定数据更丰富的模型(如 Llama 3.1-8B)通常优于语言多样性较低但规模更大的模型(如 GPT-3.5)。
引用
@article{arxiv.2405.15453,
title = {Benchmarking the Performance of Pre-trained LLMs across Urdu NLP Tasks},
author = {Munief Hassan Tahir and Sana Shams and Layba Fiaz and Farah Adeeba and Sarmad Hussain},
journal= {arXiv preprint arXiv:2405.15453},
year = {2025}
}