MemeFier:用于图像模因分类的双阶段模态融合
计算机视觉与模式识别
2023-04-10 v2
摘要
仇恨言论是一种经由互联网显著增长的社会问题。图像模因(image meme)等新型数字内容催生了利用多模态手段传播仇恨的形式,相较于单模态情形远更难分析与检测。对此类内容的准确自动处理、分析与理解,将助力遏制数字世界中仇恨言论泛滥的努力。为此,我们提出 MemeFier,一种基于深度学习的架构,用于互联网图像模因的细粒度分类,其利用了双阶段模态融合模块。第一融合阶段产生包含模态对齐信息的特征向量,捕获模因文本与图像间非平凡关联。第二融合阶段借助 Transformer 编码器的能力在词元级别学习模态间相关性并给出信息丰富的表示。此外,我们将外部知识作为额外输入,并将背景图像描述监督作为正则化组件。在三个广泛采用的基准(即 Facebook Hateful Memes、Memotion7k 与 MultiOFF)上的大量实验表明,我们的方法具有竞争力,并在某些情况下超越 SOTA。我们的代码发布于 https://github.com/ckoutlis/memefier。
引用
@article{arxiv.2304.02906,
title = {MemeFier: Dual-stage Modality Fusion for Image Meme Classification},
author = {Christos Koutlis and Manos Schinas and Symeon Papadopoulos},
journal= {arXiv preprint arXiv:2304.02906},
year = {2023}
}
备注
8 pages, 2 figures, ICMR 2023