大语言模型是否在所有语言上表现均等?面向低资源语言的比较研究
计算与语言
2024-08-06 v1
摘要
大型语言模型(LLM)在自然语言处理(NLP)中受到广泛关注,尤其是其在资源丰富语言上的各类下游任务中的卓越表现。近期研究已凸显 LLM 在低资源语言中的局限性,主要聚焦于二元分类任务,对南亚语言的关注极少。这一局限性主要归因于数据稀缺、计算成本高以及低资源语言特有的研究空白。为弥补这一差距,我们为情感分析和仇恨言论任务构建了从英文翻译得到的孟加拉、印地语和乌尔都语数据集,促进低资源语言处理的研究。进一步,我们在英文及广泛使用的南亚语言上全面评估了零样本学习中多种 LLM 的表现。我们的发现表明,GPT-4 在所有模型中表现最佳,而英文在各类任务中始终显著优于低资源语言。此外,我们的分析显示,自然语言推理(NLI)是各评估任务中表现最好的,而 GPT-4 的能力亦表现出色。
引用
@article{arxiv.2408.02237,
title = {Do Large Language Models Speak All Languages Equally? A Comparative Study in Low-Resource Settings},
author = {Md. Arid Hasan and Prerona Tarannum and Krishno Dey and Imran Razzak and Usman Naseem},
journal= {arXiv preprint arXiv:2408.02237},
year = {2024}
}