不可仇恨:应对网络仇恨言论
社会与信息网络
2019-04-08 v2
摘要
社交媒体中的仇恨内容日益增长。尽管 Facebook、Twitter、Google 已尝试采取若干措施应对仇恨内容,但大体上未获成功。反言论被视为在不损害言论自由的前提下应对网络仇恨的有效方式。因此,这些平台的一种替代策略可以是推广反言论以作为对抗仇恨内容的防御手段。然而,为了成功推广此类反言论,必须深入理解其在网络世界中的动态机制。精心标注数据的缺乏在很大程度上阻碍了这种理解。在本文中,我们利用 YouTube 的评论创建并发布了首个反言论数据集。该数据包含13,924条人工标注评论,标签指示某条评论是否为反言论。该数据使我们能够首次对反言论的语言结构进行严格的测量研究。该分析得出了若干有趣见解,例如:与非反言论评论相比,反言论评论获得更多点赞;对于某些社群,多数非反言论评论往往是仇恨言论;不同类型的反言论并非同样有效;且发布反言论用户的语言选择通过详细的心理语言学分析显示与发布非反言论的用户大不相同。最后,我们构建了一组机器学习模型,能够以0.71的 F1-score 自动检测 YouTube 视频中的反言论。我们还构建了多标签模型,能以0.60的 F1-score 检测评论中不同类型的反言论。
引用
@article{arxiv.1808.04409,
title = {Thou shalt not hate: Countering Online Hate Speech},
author = {Binny Mathew and Punyajoy Saha and Hardik Tharad and Subham Rajgaria and Prajwal Singhania and Suman Kalyan Maity and Pawan Goyal and Animesh Mukherje},
journal= {arXiv preprint arXiv:1808.04409},
year = {2019}
}
备注
Accepted at ICWSM 2019. 12 Pages, 5 Figures, and 7 Tables. The dataset and models are available here: https://github.com/binny-mathew/Countering_Hate_Speech_ICWSM2019