LAraBench:基于大语言模型的阿拉伯语 AI 基准评测
计算与语言
2024-02-06 v2 人工智能
摘要
大语言模型(LLMs)的近期进展显著影响了语言与语音研究的格局。尽管取得进展,这些模型仍缺乏针对特定语言与任务定制的最先进(SOTA)模型的专门基准评测。LAraBench 填补了阿拉伯语自然语言处理(NLP)与语音处理任务(包括跨不同领域的序列标注与内容分类)的这一空白。我们使用了 GPT-3.5-turbo、GPT-4、BLOOMZ、Jais-13b-chat、Whisper 和 USM 等模型,采用零样本与少样本学习技术处理 61 个公开可用数据集上的 33 个不同任务。这涉及 98 个实验设置,涵盖约 296K 数据点、约 46 小时语音以及 30 个用于文本转语音(TTS)的句子。该工作产生了 330+ 组实验。我们的分析聚焦于衡量 SOTA 模型与 LLMs 之间的性能差距。观察到的总体趋势是,SOTA 模型在零样本学习中通常优于 LLMs,仅有少数例外。值得注意的是,采用少样本学习技术的更大计算模型成功缩小了这些性能差距。我们的发现为 LLMs 在阿拉伯语 NLP 与语音处理任务中的适用性提供了宝贵见解。
引用
@article{arxiv.2305.14982,
title = {LAraBench: Benchmarking Arabic AI with Large Language Models},
author = {Ahmed Abdelali and Hamdy Mubarak and Shammur Absar Chowdhury and Maram Hasanain and Basel Mousi and Sabri Boughorbel and Yassine El Kheir and Daniel Izham and Fahim Dalvi and Majd Hawasly and Nizi Nazar and Yousseif Elshahawy and Ahmed Ali and Nadir Durrani and Natasa Milic-Frayling and Firoj Alam},
journal= {arXiv preprint arXiv:2305.14982},
year = {2024}
}
备注
Foundation Models, Large Language Models, Arabic NLP, Arabic Speech, Arabic AI, GPT3.5 Evaluation, USM Evaluation, Whisper Evaluation, GPT-4, BLOOMZ, Jais13b