HausaMovieReview:面向低资源非洲语言情感分析的基准数据集
计算与语言
2025-09-23 v1 人工智能
摘要
为低资源语言开发自然语言处理(NLP)工具的发展严重受限于标注数据集的稀缺。这项工作通过引入HausaMovieReview,一个包含5000条哈萨语和英语代码混合评论的新型基准数据集来解决这一根本性挑战。该数据集由三位独立标注者仔细标注,表明其与标注者之间的一致性达到了0.85的Fleiss's Kappa得分。我们使用该数据集进行了经典模型(Logistic回归、决策树、K近邻)和微调转换模型(BERT和RoBERTa)的比较分析。我们的结果揭示了一个关键发现:决策树分类器在准确率和F1得分上分别达到了89.72%和89.60%,显著优于深度学习模型。我们的发现还提供了一个稳健的基线,表明在低资源环境中,有效的特征工程即可实现最先进的性能,从而为未来研究奠定了坚实的基础。关键词:Hausa、Kannywood、Low-Resource Languages、NLP、Sentiment Analysis
引用
@article{arxiv.2509.16256,
title = {HausaMovieReview: A Benchmark Dataset for Sentiment Analysis in Low-Resource African Language},
author = {Asiya Ibrahim Zanga and Salisu Mamman Abdulrahman and Abubakar Ado and Abdulkadir Abubakar Bichi and Lukman Aliyu Jibril and Abdulmajid Babangida Umar and Alhassan Adamu and Shamsuddeen Hassan Muhammad and Bashir Salisu Abubakar},
journal= {arXiv preprint arXiv:2509.16256},
year = {2025}
}
备注
Masters Thesis, a Dataset Paper