NaijaSenti:用于多语言情感分析的尼日利亚推特情感语料库
计算与语言
2022-06-22 v3 人工智能
摘要
情感分析是 NLP 中研究最广泛的应用之一,但大多数工作聚焦于拥有大量数据的语言。我们引入了首个大规模人工标注的、针对尼日利亚四种最广泛使用语言(Hausa、Igbo、Nigerian-Pidgin 和 Yorùbá)的推特情感数据集,每种语言约 30,000 条标注推文(Nigerian-Pidgin 为 14,000 条),包含显著比例的代码混合推文。我们提出文本收集、过滤、处理和标注方法,使我们能够为这些低资源语言创建数据集。我们在该数据集上评估了一系列预训练模型与迁移策略。我们发现特定语言模型和语言自适应微调通常表现最佳。我们发布数据集、训练模型、情感词典和代码,以激励对代表性不足语言情感分析的研究。
引用
@article{arxiv.2201.08277,
title = {NaijaSenti: A Nigerian Twitter Sentiment Corpus for Multilingual Sentiment Analysis},
author = {Shamsuddeen Hassan Muhammad and David Ifeoluwa Adelani and Sebastian Ruder and Ibrahim Said Ahmad and Idris Abdulmumin and Bello Shehu Bello and Monojit Choudhury and Chris Chinenye Emezue and Saheed Salahudeen Abdullahi and Anuoluwapo Aremu and Alipio Jeorge and Pavel Brazdil},
journal= {arXiv preprint arXiv:2201.08277},
year = {2022}
}
备注
Submitted to LREC 2022, 13 pages, 2 figures