多模态 Meme 中的仇恨言论检测
计算机视觉与模式识别
2021-01-01 v1 机器学习
摘要
过去几年中,从图像描述到视觉问答及更广领域,多模态问题引起了大量关注。本文中,我们聚焦于多模态 meme 中的仇恨言论检测,其中 meme 构成了一个有趣的多模态融合问题。我们旨在解决 Facebook Meme Challenge \cite{kiela2020hateful},该挑战旨在解决预测一个 meme 是否含有仇恨内容的二分类问题。该挑战的一个关键特征是包含“良性混淆因子”以抵消模型利用单模态先验的可能性。挑战指出,最先进模型的表现远逊于人类。在数据集分析过程中,我们意识到,大量原本含仇恨内容的数据点仅通过描述 meme 的图像就被转为良性。此外,多数多模态基线更偏好仇恨言论(语言模态)。为应对这些问题,我们利用目标检测与图像描述模型探索视觉模态以获取“真实描述”,再将其与多模态表示结合进行二分类。该方法应对了数据集中存在的良性文本混淆因子,从而提升性能。我们实验的另一方法是借助情感分析改进预测:除使用预训练神经网络所得多模态表示外,我们还引入单模态情感以丰富特征。我们对上述两种方法进行了详细分析,并给出了支持所用方法的充分理由。
引用
@article{arxiv.2012.14891,
title = {Detecting Hate Speech in Multi-modal Memes},
author = {Abhishek Das and Japsimar Singh Wahi and Siyao Li},
journal= {arXiv preprint arXiv:2012.14891},
year = {2021}
}