自动仇恨言论检测与冒犯性语言问题
计算与语言
2017-03-14 v1
摘要
社交媒体上自动仇恨言论检测的一个关键挑战是将仇恨言论与其他冒犯性语言实例区分开来。基于词汇的检测方法往往精度较低,因为它们将所有包含特定词语的消息归类为仇恨言论,而先前使用监督学习的工作未能区分这两个类别。我们使用了一个众包的仇恨言论词典来收集包含仇恨言论关键词的推文。我们利用众包将这些推文的样本标记为三类:包含仇恨言论的、仅包含冒犯性语言的,以及两者皆无的。我们训练了一个多类分类器来区分这些不同类别。对预测和错误的仔细分析表明,何时我们可以可靠地将仇恨言论与其他冒犯性语言分开,以及何时这种区分更加困难。我们发现种族主义和恐同推文更可能被归类为仇恨言论,但性别歧视推文通常被归类为冒犯性言论。不含明确仇恨关键词的推文也更难分类。
引用
@article{arxiv.1703.04009,
title = {Automated Hate Speech Detection and the Problem of Offensive Language},
author = {Thomas Davidson and Dana Warmsley and Michael Macy and Ingmar Weber},
journal= {arXiv preprint arXiv:1703.04009},
year = {2017}
}
备注
To appear in the Proceedings of ICWSM 2017. Please cite that version