NLP-LTU在SemEval-2023任务10上的工作:数据增强与半监督学习技术对不平衡数据集上文本分类性能的影响
计算与语言
2023-04-26 v1
摘要
在本文中,我们提出了针对SemEval23任务10的方法,聚焦于检测和分类社交媒体帖子中的网络性别歧视。该任务应对一个严峻问题,因为检测社交媒体平台上的有害内容对于减轻这些帖子对用户的危害至关重要。我们针对该任务的解决方案基于微调的基于transformer的模型集成(BERTweet、RoBERTa和DeBERTa)。为缓解类别不平衡相关问题并提升模型泛化能力,我们还尝试了数据增强与半监督学习。具体而言,对于数据增强,我们使用回译,应用于所有类别或仅应用于代表性不足类别。我们通过大量实验分析了这些策略对整个流程总体性能的影响;而对于半监督学习,我们发现当有大量未标记的同领域数据可用时,半监督学习能提升某些模型的性能。我们提出的方法(源代码已在Github上提供)在子任务A上获得了0.8613的F1分数,使我们在竞赛中排名第10。
引用
@article{arxiv.2304.12847,
title = {NLP-LTU at SemEval-2023 Task 10: The Impact of Data Augmentation and Semi-Supervised Learning Techniques on Text Classification Performance on an Imbalanced Dataset},
author = {Sana Sabah Al-Azzawi and György Kovács and Filip Nilsson and Tosin Adewumi and Marcus Liwicki},
journal= {arXiv preprint arXiv:2304.12847},
year = {2023}
}
备注
6 pages, 5 figures , This paper has beed accepted in SemEval workshop at ACL 2023 conference