Hate-CLIPper:基于CLIP特征跨模态交互的多模态仇恨表情包分类
计算与语言
2022-10-18 v3 计算机视觉与模式识别
机器学习
多媒体
摘要
仇恨表情包在社交媒体上日益成为威胁。虽然表情包中的图像与对应文本相互关联,但单独观看时未必传达相同含义。因此,检测仇恨表情包需要仔细考量视觉与文本信息。多模态预训练对此任务有益,因为它通过将图像与文本表示于相似特征空间来有效捕捉二者关系。此外,通过中间融合对图像与文本特征间交互建模至关重要。多数现有方法仅采用多模态预训练或中间融合之一,而非两者兼具。本文提出Hate-CLIPper架构,其通过特征交互矩阵(FIM)显式建模利用对比语言-图像预训练(CLIP)编码器所得图像与文本表示间的跨模态交互。基于FIM表示的简单分类器在Hateful Memes Challenge(HMC)数据集上以85.8的AUROC取得最先进性能,甚至超越82.65的人类表现。在Propaganda Memes与TamilMemes等其他表情包数据集上的实验也证明了所提方法的泛化性。最后,我们分析FIM表示的可解释性,表明跨模态交互确实能促进有意义概念的学习。本工作代码见https://github.com/gokulkarthik/hateclipper。
引用
@article{arxiv.2210.05916,
title = {Hate-CLIPper: Multimodal Hateful Meme Classification based on Cross-modal Interaction of CLIP Features},
author = {Gokul Karthik Kumar and Karthik Nandakumar},
journal= {arXiv preprint arXiv:2210.05916},
year = {2022}
}
备注
Accepted at EMNLP 2022 Workshop on NLP for Positive Impact