中文

MOMENTA:一种用于检测有害表情包及其目标的多模态框架

多媒体 2021-09-23 v2 计算与语言

摘要

网络表情包已成为传播政治、心理及社会文化观念的有力手段。尽管表情包通常具有幽默性,但近来用于挑衅、网络欺凌和辱骂的有害表情包日益增多。此类表情包的检测具有挑战性,因为它们可能极具讽刺意味且含义隐晦。此外,以往工作多聚焦于表情包的某些特定方面(如仇恨言论与宣传),针对一般性危害的研究甚少。本文旨在弥补这一不足。我们关注两项任务:(i) 检测有害表情包,以及 (ii) 识别其所针对的社会实体。我们进一步扩展了近期发布的 HarMeme 数据集(该数据集涵盖 COVID-19),增补了更多表情包及一个新主题:美国政治。为完成这些任务,我们提出 MOMENTA(MultimOdal framework for detecting harmful MemEs aNd Their tArgets,用于检测有害表情包及其目标的多模态框架),一种利用全局与局部视角检测有害表情包的新型多模态深度神经网络。MOMENTA 系统性地分析输入表情包(两种模态下)的局部与全局视角,并将其与背景上下文相关联。MOMENTA 具有可解释性与可泛化性,实验表明其优于若干强基线方法。

关键词

引用

@article{arxiv.2109.05184,
  title  = {MOMENTA: A Multimodal Framework for Detecting Harmful Memes and Their Targets},
  author = {Shraman Pramanick and Shivam Sharma and Dimitar Dimitrov and Md Shad Akhtar and Preslav Nakov and Tanmoy Chakraborty},
  journal= {arXiv preprint arXiv:2109.05184},
  year   = {2021}
}

备注

The paper has been accepted in the Findings of Empirical Methods in Natural Language Processing (EMNLP), 2021