中文

基于互补视觉与语言网络的仇恨表情包检测

计算机视觉与模式识别 2020-12-10 v1

摘要

仇恨表情包在社交媒体中广泛传播并传达负面信息。仇恨表情包检测的主要挑战在于其表达含义无法由单一模态很好地识别。为了进一步融合模态信息,我们在2020年仇恨表情包挑战赛(Hateful Memes Challenge 2020)中研究了一种基于互补视觉与语言网络的候选方案。通过这种方式,可以多维度探索多模态的更全面信息。在视觉与语言嵌入中同时考虑了上下文级别与敏感目标级别信息,以构建复杂的多模态场景。具体而言,利用预训练分类器与目标检测器从输入中获取上下文特征与感兴趣区域(region-of-interests, RoIs),随后通过位置表示融合得到视觉嵌入。而语言嵌入由三部分组成,即句子词嵌入、位置嵌入以及相应的Spacy嵌入(Sembedding),后者是由Spacy提取的词汇所表示的符号。视觉与语言嵌入均被输入至所设计的互补视觉与语言(Complementary Visual and Linguistic, CVL)网络以产生仇恨表情包预测。在仇恨表情包挑战赛数据集上的实验结果表明,CVL取得了良好的性能,在AUROC与准确率指标上分别达到78.48%与72.95%。代码见 https://github.com/webYFDT/hateful。

关键词

引用

@article{arxiv.2012.04977,
  title  = {Hateful Memes Detection via Complementary Visual and Linguistic Networks},
  author = {Weibo Zhang and Guihua Liu and Zhuohua Li and Fuqing Zhu},
  journal= {arXiv preprint arXiv:2012.04977},
  year   = {2020}
}

备注

5 pages, 1 figure