将模因映射至词项以实现多模态仇恨模因分类
计算机视觉与模式识别
2023-10-13 v1
摘要
多模态图文模因在互联网上十分普遍,作为一种独特的交流形式,它结合视觉与文本元素来传达幽默、观点或情感。然而,部分模因走向恶意,宣扬仇恨内容并助长歧视。在此多模态语境下检测仇恨模因是一项挑战性任务,需要理解文本与图像交织的含义。本工作中,我们提出一种名为 ISSUES 的新方法以解决该问题,用于多模态仇恨模因分类。ISSUES 利用预训练的 CLIP 视觉-语言模型与文本反演技术,有效捕捉模因的多模态语义内容。实验表明,我们的方法在 Hateful Memes Challenge 与 HarMeme 数据集上取得了最先进的结果。代码与预训练模型公开于 https://github.com/miccunifi/ISSUES。
引用
@article{arxiv.2310.08368,
title = {Mapping Memes to Words for Multimodal Hateful Meme Classification},
author = {Giovanni Burbi and Alberto Baldrati and Lorenzo Agnolucci and Marco Bertini and Alberto Del Bimbo},
journal= {arXiv preprint arXiv:2310.08368},
year = {2023}
}
备注
ICCV2023 CLVL Workshop