NLP中的模型偏差——基于迁移学习技术的仇恨言论分类应用
计算与语言
2021-10-12 v4 人工智能
摘要
本文将一个基于BERT的神经网络模型应用于JIGSAW数据集,以构建一个识别在线社交平台(英语)中仇恨性和毒性评论(严格区别于攻击性语言)的模型,此处为Twitter。另三种神经网络架构和一个GPT-2模型也应用于所提供的数据集以比较这些不同模型。训练后的BERT模型随后被应用于两个不同数据集以评估其泛化能力,即另一个Twitter数据集和包含Twitter及Facebook评论的HASOC 2019数据集;我们聚焦于英语HASOC 2019数据。此外,可以表明通过在这些数据集上以迁移学习场景重新训练部分或全部层来微调训练好的BERT模型,相比直接应用基于JIGSAW数据预训练的模型,预测分数有所提升。凭借我们的结果,我们获得了从64%到约90%的精确率,同时仍达到至少60%出头的尚可召回值,证明BERT适用于社交平台中的实际用例。
引用
@article{arxiv.2109.09725,
title = {Model Bias in NLP -- Application to Hate Speech Classification using transfer learning techniques},
author = {Aygul Zagidullina and Georgios Patoulidis and Jonas Bokstaller},
journal= {arXiv preprint arXiv:2109.09725},
year = {2021}
}
备注
13 pages, 7 figures