Twitter 上仇恨用户的刻画与检测
计算机与社会
2018-03-28 v1 社会与信息网络
摘要
当前大多数刻画和检测仇恨言论的方法都聚焦于在线社交网络中发布的“内容”。由于在线社交网络文本的不完整性和噪声以及仇恨言论的主观性,它们在收集和标注仇恨言论时面临不足。这些局限性往往辅以将问题过度简化的约束,例如仅考虑包含仇恨相关词汇的推文。在本研究中,我们将焦点转向“用户”,部分解决了这些问题。我们开发并采用了一种稳健的方法来收集和标注仇恨用户,该方法不直接依赖于词典,且用户的标注是基于其完整档案进行的。这产生了一个包含 名用户的 Twitter 转推图样本,其中 名被标注。我们还收集了在数据收集后三个月内被封禁的用户。我们表明,仇恨用户在活动模式、词汇使用以及网络结构方面不同于正常用户。在比较仇恨用户的邻居与正常用户的邻居以及被封禁用户与活跃用户时,我们获得了类似的结果,增强了分析的稳健性。我们观察到仇恨用户之间连接紧密,因此将仇恨言论检测问题表述为图上半监督学习的任务,利用 Twitter 上的连接网络。我们发现,利用图结构的节点嵌入算法在检测仇恨用户( AUC 对比 AUC)和被封禁用户( AUC 对比 AUC)方面均优于基于内容的方法。总而言之,我们提出了仇恨言论的以用户为中心的视角,为更好地检测和理解这一相关且具挑战性的问题铺平了道路。
引用
@article{arxiv.1803.08977,
title = {Characterizing and Detecting Hateful Users on Twitter},
author = {Manoel Horta Ribeiro and Pedro H. Calais and Yuri A. Santos and Virgílio A. F. Almeida and Wagner Meira},
journal= {arXiv preprint arXiv:1803.08977},
year = {2018}
}
备注
This is an extended version of the homonymous short paper to be presented at ICWSM-18. arXiv admin note: text overlap with arXiv:1801.00317