中文

将模因映射至词项以实现多模态仇恨模因分类

计算机视觉与模式识别 2023-10-13 v1

摘要

多模态图文模因在互联网上十分普遍,作为一种独特的交流形式,它结合视觉与文本元素来传达幽默、观点或情感。然而,部分模因走向恶意,宣扬仇恨内容并助长歧视。在此多模态语境下检测仇恨模因是一项挑战性任务,需要理解文本与图像交织的含义。本工作中,我们提出一种名为 ISSUES 的新方法以解决该问题,用于多模态仇恨模因分类。ISSUES 利用预训练的 CLIP 视觉-语言模型与文本反演技术,有效捕捉模因的多模态语义内容。实验表明,我们的方法在 Hateful Memes Challenge 与 HarMeme 数据集上取得了最先进的结果。代码与预训练模型公开于 https://github.com/miccunifi/ISSUES。

关键词

引用

@article{arxiv.2310.08368,
  title  = {Mapping Memes to Words for Multimodal Hateful Meme Classification},
  author = {Giovanni Burbi and Alberto Baldrati and Lorenzo Agnolucci and Marco Bertini and Alberto Del Bimbo},
  journal= {arXiv preprint arXiv:2310.08368},
  year   = {2023}
}

备注

ICCV2023 CLVL Workshop