大语言模型作为低资源语言标注器的局限性研究
计算与语言
2025-03-04 v2 机器学习
摘要
低资源语言因缺乏足够的语言数据、资源和工具(如监督学习、标注和分类),面临着显著的挑战。这种短缺限制了准确模型和数据集的开发,使进行情感分析或仇恨言论检测等关键 NLP 任务变得困难。大语言模型(LLM)作为潜在标注器的机会,能够为这些缺乏资源的语言生成数据集和资源。本文聚焦于马拉里语(Marathi),一种低资源语言,评估了闭源和开源 LLM 作为标注器的性能,并将其结果与微调 BERT 模型进行比较。我们在情感分析、新闻分类和仇恨言论检测等分类任务上评估了 GPT-4o、Gemini 1.0 Pro、Gemma 2(2B 和 9B)以及 Llama 3.1(8B 和 405B)等模型。我们的发现表明,尽管 LLM 在英语等高资源语言的标注任务中表现出色,但在马拉里语应用时仍显不足。即便是 GPT-4o 和 Llama 3.1 405B 等先进模型,也不及微调 BERT 基线模型,分别落后 10.2% 和 14.1% 的准确率。这一结果凸显了 LLM 在低资源语言标注中的局限性。
引用
@article{arxiv.2411.17637,
title = {On Limitations of LLM as Annotator for Low Resource Languages},
author = {Suramya Jadhav and Abhay Shanbhag and Amogh Thakurdesai and Ridhima Sinare and Raviraj Joshi},
journal= {arXiv preprint arXiv:2411.17637},
year = {2025}
}