中文

针对图像描述的隐形定向后门攻击

密码学与安全 2024-06-11 v1

摘要

近年来,多模态学习出现了快速增长。图像描述作为一种经典的多模态任务,已展现出广泛的应用前景并吸引了大量研究关注。然而,近期研究表明,图像描述模型对某些安全威胁(如后门攻击)存在脆弱性。现有的针对图像描述的后门攻击通常将触发器与预定义句子或单个单词配对作为定向输出,但这些输出与图像内容无关,容易被人类察觉为异常。本文提出了一种新的方法,用于制造针对图像描述模型的隐形定向后门攻击。具体而言,我们首先利用目标检测的通用扰动技术学习特殊触发器,然后将学习到的触发器置于某些特定源目标对象的中心,并将输出描述中对应目标名称修改为预定义的目标名称。在预测阶段,具有触发器的输入图像由后门模型生成的描述能够准确传达整个图像其余部分的语义信息,同时错误地将源目标识别为预定义的目标。大量实验表明,我们的方法可实现高攻击成功率,同时对模型干净性能的影响微乎其微。此外,我们展示了该方法在图像和文本领域中隐形,因为所产生的后门样本与干净样本无异,可成功规避现有的后门防御措施,凸显了需要更好的防御机制以应对此类隐形后门攻击的必要性。

关键词

引用

@article{arxiv.2406.05874,
  title  = {Stealthy Targeted Backdoor Attacks against Image Captioning},
  author = {Wenshu Fan and Hongwei Li and Wenbo Jiang and Meng Hao and Shui Yu and Xiao Zhang},
  journal= {arXiv preprint arXiv:2406.05874},
  year   = {2024}
}