中文

可解释的多模态仇恨言论检测

计算与语言 2021-03-03 v1 机器学习

摘要

随着社交媒体在塑造全球公众舆论与信念方面的作用日益增强,人们越来越关注识别并应对社交媒体上的仇恨言论问题。网络空间的仇恨言论具有严重的表现形式,包括社会两极分化和仇恨犯罪。尽管先前工作已提出自动检测网络仇恨言论的技术,但这些技术主要未能超越文本内容进行考察。此外,鉴于错误预测所带来的社会与法律影响,极少有尝试关注此类模型的可解释性方面。在本工作中,我们提出一种深度神经多模态模型,该模型能够:(a) 通过有效捕捉文本语义以及特定仇恨表达所处的社会文化语境来检测仇恨言论;(b) 提供关于我们模型决策的可解释性洞察。通过对不同建模技术进行详尽评估,我们证明我们的模型能够优于现有的最先进(state-of-the-art, SOTA)仇恨言论分类方法。最后,我们展示了社会与文化语境特征对于揭示与不同类别仇恨相关的聚类的重要性。

关键词

引用

@article{arxiv.2103.01616,
  title  = {Interpretable Multi-Modal Hate Speech Detection},
  author = {Prashanth Vijayaraghavan and Hugo Larochelle and Deb Roy},
  journal= {arXiv preprint arXiv:2103.01616},
  year   = {2021}
}

备注

5 pages, Accepted at the International Conference on Machine Learning AI for Social Good Workshop, Long Beach, United States, 2019