解读隐性仇恨:多模态仇恨内容自动检测算法的评估
计算与语言
2021-06-11 v1 计算机视觉与模式识别
计算机与社会
机器学习
摘要
在线仇恨内容的准确检测与分类是一项困难的任务。隐性仇恨尤其具有挑战性,因为此类内容往往具有异常句法、多义词以及较少的偏见标记(例如污蔑性言辞)。随着多模态内容(如将文本与图像结合的表情包)的出现,这一问题更加严重,因为它们通常比单模态内容(例如仅文本)更难解读。本文评估了语义与多模态上下文在检测隐性与显性仇恨中的作用。我们表明,文本与视觉的增强均提升了模型性能,其中多模态模型(0.771)的F1分数优于其他模型(0.544、0.737和0.754)。尽管单模态文本上下文感知(transformer)模型在隐性仇恨检测子任务上最为准确,但多模态模型因其更低的假阳性倾向而在整体上优于它。我们发现所有模型在具有完全标注者一致性的内容上表现更好,且多模态模型最擅长对标注者存在分歧的内容进行分类。为开展这些研究,我们对5000条多模态条目样本进行了高质量标注。推文被标注了主要类别、模态与策略。我们免费公开了该语料库以及编码手册、代码与最终模型。
引用
@article{arxiv.2106.05903,
title = {Deciphering Implicit Hate: Evaluating Automated Detection Algorithms for Multimodal Hate},
author = {Austin Botelho and Bertie Vidgen and Scott A. Hale},
journal= {arXiv preprint arXiv:2106.05903},
year = {2021}
}
备注
Please note the paper contains examples of hateful content