中文

应对自动化在线仇恨检测中的种族偏见:基于几何深度学习实现仇恨用户公平准确分类

社会与信息网络 2021-03-23 v1 计算机与社会 机器学习

摘要

在线仇恨在许多社交媒体平台及其他网站上日益引发关注。为应对此问题,科技公司正越来越多地识别并制裁“仇恨用户”,而非仅审核仇恨内容。然而,迄今为止多数在线仇恨检测研究聚焦于仇恨内容。本文探讨如何通过几何深度学习融入社交网络信息,开发更公平且更准确的仇恨用户检测系统。几何深度学习动态学习信息丰富的网络表示,并可泛化至未见节点。这对于超越手动设计的网络特征至关重要,后者缺乏可扩展性且产生信息稀疏的网络表示。本文将几何深度学习的准确性与排除网络信息或通过手动特征工程(如node2vec)融入网络信息的其他技术进行比较。其亦使用“预测均等”准则评估这些技术的公平性,比较136名非裔美国用户子集与4836名其他用户的假阳性率。几何深度学习产生了最准确且最公平的 classifier,在完整数据集上AUC达90.8%,且表现最佳模型在非裔美国子集中的假阳性率为零。这凸显了在自动化仇恨用户检测中更有效融入社交网络特征的益处。该方法因高效且可扩展的设计,亦易于在实际内容审核中落地应用。

关键词

引用

@article{arxiv.2103.11806,
  title  = {Tackling Racial Bias in Automated Online Hate Detection: Towards Fair and Accurate Classification of Hateful Online Users Using Geometric Deep Learning},
  author = {Zo Ahmed and Bertie Vidgen and Scott A. Hale},
  journal= {arXiv preprint arXiv:2103.11806},
  year   = {2021}
}