利用非洟BERTa模型探讨语言自适应微调对豪萨语情感分析影响的研究
计算与语言
2025-01-22 v1
摘要
情感分析(情感分析)在自然语言处理中发挥着重要作用,~用于识别文本中表达的情感。虽然已对广泛使用语言的情感分析取得了显著进展,但低资源语言如豪萨语面临独特挑战,主要由于缺乏数字资源。本研究考察了语言自适应微调(LAFT)提高豪萨语情感分析性能的有效性。我们首先构建多样化的无标签语料库以扩充模型的语言能力,随后应用LAFT针对豪萨语的细微差异进行微调。然后,在标注的NaijaSenti情感数据集上对调整后的模型进行微调,以评估其性能。我们的发现表明,LAFT提供了适度的改进,这可能归因于使用正式的豪萨语文本而非非正式的社交媒体数据。尽管如此,预训练的非洟BERTa模型显著优于未专门在豪萨语上训练的模型,突显了在低资源环境中使用预训练模型的重要性。这项研究强调了为低资源非洲语言发展NLP应用所需多样化数据源的必要性。我们在此处发布了代码和数据集,以鼓励进一步的研究并促进低资源NLP中可重复性:https://github.com/Sani-Abdullahi-Sani/Natural-Language-Processing/blob/main/Sentiment%20Analysis%20for%20Low%20Resource%20African%20Languages
引用
@article{arxiv.2501.11023,
title = {Investigating the Impact of Language-Adaptive Fine-Tuning on Sentiment Analysis in Hausa Language Using AfriBERTa},
author = {Sani Abdullahi Sani and Shamsuddeen Hassan Muhammad and Devon Jarvis},
journal= {arXiv preprint arXiv:2501.11023},
year = {2025}
}