基于数据增强方法的仇恨言论检测无监督域自适应
计算与语言
2021-08-03 v2
摘要
近年来,以仇恨言论形式出现的网络骚扰呈上升趋势。解决该问题需要人工内容审核与自动检测方法相结合。由于内容审核本身对审核人员有害,我们希望通过改进仇恨言论的自动检测来减轻其负担。仇恨言论针对不同的目标群体并使用完全不同的词汇,这带来了挑战。此外,仇恨言论的发布者有动机掩饰其行为以避免被平台移除。这使得难以开发一个全面的数据集来训练和评估仇恨言论检测模型,因为代表某一仇恨言论领域的样本通常不能代表其他领域,即便在同一语言或文化内也是如此。我们提出了一种无监督域自适应方法来增强仇恨言论检测的标注数据。我们使用三种不同模型(字符CNN、BiLSTM和BERT)在三个不同数据集上评估该方法。结果表明,我们的方法将精确率/召回率曲线下面积(AUC-PR)提升了高达42%,召回率提升了高达278%,且精确率没有损失(某些情况下还有显著提升)。
引用
@article{arxiv.2107.12866,
title = {Unsupervised Domain Adaptation for Hate Speech Detection Using a Data Augmentation Approach},
author = {Sheikh Muhammad Sarwar and Vanessa Murdock},
journal= {arXiv preprint arXiv:2107.12866},
year = {2021}
}