中文

对抗社交媒体上的仇恨言论:仇恨与反击言论的大规模分类

计算机与社会 2020-06-09 v3 机器学习 社会与信息网络

摘要

仇恨言论正困扰着在线话语,助长极端社会运动并可能引发现实世界中的暴力。对这一日益严重的全球性问题的一个潜在解决方案是由公民生成的反击言论,即公民积极参与充满仇恨的对话,试图恢复文明的、非极化的话语。然而,其在遏制仇恨传播方面的实际有效性尚属未知且难以量化。研究这一问题的主要障碍之一是缺乏用于训练自动分类器以识别反击言论的大规模标注数据集。在此,我们利用了德国的一种独特情况,其中自我标注的群体参与了有组织的在线仇恨与反击言论。我们使用一种集成学习算法,将多种段落嵌入与正则化逻辑回归函数配对,对来自这两个群体的数百万条相关推文中的仇恨言论和反击言论进行分类。我们的流程在样本外平衡测试集上取得的宏 F1 分数介于 0.76 到 0.97 之间——其准确度达到甚至超过了当前最优水平。在数千条推文上,我们使用众包来验证分类器所做的判断与人类判断高度一致。然后,我们使用该分类器在 2013 年至 2018 年发生的超过 135,000 个完全解析的 Twitter 对话中发现仇恨言论和反击言论,并研究它们的频率与互动。总之,我们的结果凸显了自动化方法在评估协调反击言论稳定社交媒体对话影响方面的潜力。

关键词

引用

@article{arxiv.2006.01974,
  title  = {Countering hate on social media: Large scale classification of hate and counter speech},
  author = {Joshua Garland and Keyan Ghazi-Zahedi and Jean-Gabriel Young and Laurent Hébert-Dufresne and Mirta Galesic},
  journal= {arXiv preprint arXiv:2006.01974},
  year   = {2020}
}