你只需要“爱”:规避仇恨言论检测
计算与语言
2018-11-06 v3
摘要
随着社交网络的传播及其对仇恨言论的不幸使用,后者的自动检测已成为一个紧迫问题。在本文中,我们复现了先前工作中的七个最先进仇恨言论检测模型,并表明它们仅当在与训练所用数据类型相同的测试数据上才表现良好。基于这些结果,我们认为成功的仇恨言论检测中,模型架构不如数据类型和标注标准重要。我们进一步表明,所有提出的检测技术都容易受到能够(自动)插入拼写错误、改变词边界或向原始仇恨言论添加无害词汇的对抗者的攻击。这些方法的组合也对 Google Perspective(业界的一种前沿解决方案)有效。我们的实验表明,对抗训练并不能完全缓解这些攻击,并且使用字符级特征比使用词级特征使模型系统性地更具抗攻击性。
引用
@article{arxiv.1808.09115,
title = {All You Need is "Love": Evading Hate-speech Detection},
author = {Tommi Gröndahl and Luca Pajola and Mika Juuti and Mauro Conti and N. Asokan},
journal= {arXiv preprint arXiv:1808.09115},
year = {2018}
}
备注
11 pages, Proceedings of the 11th ACM Workshop on Artificial Intelligence and Security (AISec) 2018