中文

HateProof:仇恨表情包检测系统真的鲁棒吗?

计算与语言 2023-02-14 v1 人工智能

摘要

多年来,利用社交媒体传播仇恨内容的现象急剧增加。近来,表情包等多模态仇恨内容比单模态内容获得了相对更多的关注。此外,隐含内容载荷的存在使得现有仇恨表情包检测系统难以对其进行检测。在本文中,我们提出一项用例研究,以分析此类系统在面对外部对抗攻击时的脆弱性。我们发现,即便是由对模型知之甚少的人所实施的、在单模态与多模态设定下进行的非常简单的扰动,也能使现有检测模型变得高度脆弱。经验上,我们发现某些攻击下宏F1分数出现了高达10%的显著性能下降。作为补救,我们尝试使用对比学习以及一种基于对抗训练的方法——VILLA,来提升模型的鲁棒性。通过集成上述两种方法,在我们的两个高分辨率数据集中,我们能够在很大程度上(重新)挽回某些攻击下的性能。我们认为,我们的工作是朝着在对抗环境下解决这一关键问题的第一步,并将在未来启发更多此类研究。

关键词

引用

@article{arxiv.2302.05703,
  title  = {HateProof: Are Hateful Meme Detection Systems really Robust?},
  author = {Piush Aggarwal and Pranit Chawla and Mithun Das and Punyajoy Saha and Binny Mathew and Torsten Zesch and Animesh Mukherjee},
  journal= {arXiv preprint arXiv:2302.05703},
  year   = {2023}
}

备注

Accepted at TheWebConf'2023 (WWW'2023)