中文

HausaNLP 在 SemEval-2023 任务 12:利用非洲低资源推文数据进行情感分析

计算与语言 2023-04-27 v1

摘要

我们介绍了 SemEval-2023 任务 12 的成果,该共享任务基于 Twitter 数据集对低资源非洲语言进行情感分析。任务包含三个子任务:子任务 A 为包含 12 个单语轨道的单语情感分类,均为单语语言;子任务 B 为使用子任务 A 中轨道的多语情感分类;子任务 C 为零样本情感分类。我们给出了子任务 A、B 和 C 的结果与发现,并在 github 上发布了代码。我们的目标是利用预训练的 Afro-xlmr-large、AfriBERTa-Large、Bert-base-arabic-camelbert-da-sentiment(Arabic-camelbert)、Multilingual-BERT(mBERT)和 BERT 模型,针对 14 种非洲语言,借助低资源推文数据进行情感分析。这些子任务的数据集由来自这些语言的金标准多类标注 Twitter 数据集组成。我们的结果表明,在大多数语言数据集中,Afro-xlmr-large 模型表现优于其他模型。类似地,尼日利亚语言 Hausa、Igbo 和 Yoruba 相较于其他语言取得了更好的性能,这可归因于这些语言中存在更大量的数据。

关键词

引用

@article{arxiv.2304.13634,
  title  = {HausaNLP at SemEval-2023 Task 12: Leveraging African Low Resource TweetData for Sentiment Analysis},
  author = {Saheed Abdullahi Salahudeen and Falalu Ibrahim Lawan and Ahmad Mustapha Wali and Amina Abubakar Imam and Aliyu Rabiu Shuaibu and Aliyu Yusuf and Nur Bala Rabiu and Musa Bello and Shamsuddeen Umaru Adamu and Saminu Mohammad Aliyu and Murja Sani Gadanya and Sanah Abdullahi Muaz and Mahmoud Said Ahmad and Abdulkadir Abdullahi and Abdulmalik Yusuf Jamoh},
  journal= {arXiv preprint arXiv:2304.13634},
  year   = {2023}
}