HausaNLP 在 SemEval-2023 任务 10:迁移学习、合成数据与辅助信息用于多级性别歧视分类
计算与语言
2023-05-02 v1
摘要
我们介绍了参与 SemEval-2023 任务 10:可解释在线性别歧视检测(EDOS)的发现,该共享任务基于英语 Gab 与 Reddit 数据集进行攻击性语言(性别歧视)检测。我们研究了迁移两个语言模型的效果:XLM-T(情感分类)与 HateBERT(同领域——Reddit),用于多级分类,判别是否为性别歧视,以及对性别歧视数据的后续子分类。我们还使用未标注数据集的合成分类与中间类信息来最大化模型性能。我们在任务 A 中提交了一个系统,以 0.82 的 F1 分数排名第 49。该结果表明具有竞争力,因其仅以 0.052% 的 F1 分数差距落后于最佳系统。
引用
@article{arxiv.2305.00076,
title = {HausaNLP at SemEval-2023 Task 10: Transfer Learning, Synthetic Data and Side-Information for Multi-Level Sexism Classification},
author = {Saminu Mohammad Aliyu and Idris Abdulmumin and Shamsuddeen Hassan Muhammad and Ibrahim Said Ahmad and Saheed Abdullahi Salahudeen and Aliyu Yusuf and Falalu Ibrahim Lawan},
journal= {arXiv preprint arXiv:2305.00076},
year = {2023}
}
备注
5 pages, 3 figures