中文

Meme木马:基于跨模态触发器的仇恨模因检测后门攻击

密码学与安全 2024-12-23 v1

摘要

仇恨模因检测旨在防止仇恨模因在各种社交媒体平台上的传播。考虑到其对社会环境的影响,本文引入了一种此前被忽视但对仇恨模因检测构成重大威胁的攻击方式:后门攻击。通过向模因样本中注入特定触发器,后门攻击者可以操纵检测器输出其期望的结果。为了探索这一点,我们提出了 Meme Trojan 框架,对仇恨模因检测发起后门攻击。Meme Trojan 包含创建一种新型跨模态触发器(Cross-Modal Trigger, CMT)和一个可学习的触发器增强器,以根据每个输入样本增强触发器模式。由于具有跨模态特性,所提出的 CMT 能够在自动化应用场景下有效地对仇恨模因检测器发起后门攻击。此外,我们触发器的注入位置和大小会根据模因中包含的文本进行自适应调整,从而确保触发器与模因内容无缝融合。我们的方法优于最先进的后门攻击方法,在有效性和隐蔽性方面均展现出显著提升。我们相信本文将引起人们对后门攻击对仇恨模因检测构成潜在威胁的更多关注。

关键词

引用

@article{arxiv.2412.15503,
  title  = {Meme Trojan: Backdoor Attacks Against Hateful Meme Detection via Cross-Modal Triggers},
  author = {Ruofei Wang and Hongzhan Lin and Ziyuan Luo and Ka Chun Cheung and Simon See and Jing Ma and Renjie Wan},
  journal= {arXiv preprint arXiv:2412.15503},
  year   = {2024}
}

备注

Accepted by AAAI25