中文

利用对比学习理解与检测仇恨内容

社会与信息网络 2022-05-18 v2 计算机与社会

摘要

网络上仇恨言论与仇恨图像的传播是一个亟待缓解以改善网络体验的重要问题。本工作通过对4chan的/pol/版块使用OpenAI的CLIP进行多模态分析,研究反犹太主义和伊斯兰恐惧症的检测与理解,从而为网络上仇恨内容的检测与理解研究作出贡献。这一大型预训练模型使用对比学习(Contrastive Learning)范式。我们设计了一种方法,利用Google的Perspective API和人工标注来识别一组反犹太主义和伊斯兰恐惧症的仇恨文本短语。随后,我们使用OpenAI的CLIP来识别与我们的反犹太/伊斯兰恐惧症文本短语高度相似的图像。通过在包含4chan的/pol/版块18个月内发布的6600万帖子与580万图像的数据集上运行我们的方法,我们检测到17.3万条包含2.1万张反犹太/伊斯兰恐惧症图像的帖子,以及24.6万条包含420个仇恨短语的帖子。其中我们发现,使用OpenAI的CLIP模型检测仇恨内容可达到0.81的准确率(F1分数=0.54)。通过与文献提出的两种基线比较,我们发现CLIP在检测反犹太/伊斯兰恐惧症图像上的准确率、精确率和F1分数均优于它们。此外,我们发现4chan的/pol/版块上分享反犹太/伊斯兰恐惧症图像与文本短语的帖子数量相近,凸显了设计更多仇恨图像检测工具的必要性。最后,我们(依请求)提供一个包含24.6万条含420个反犹太/伊斯兰恐惧症短语的帖子和2.1万张可能为反犹太/伊斯兰恐惧症图像(由CLIP自动检测)的数据集,可协助研究者进一步理解反犹太主义和伊斯兰教恐惧症。

关键词

引用

@article{arxiv.2201.08387,
  title  = {Understanding and Detecting Hateful Content using Contrastive Learning},
  author = {Felipe González-Pizarro and Savvas Zannettou},
  journal= {arXiv preprint arXiv:2201.08387},
  year   = {2022}
}