面向对象的图像描述后门攻击
计算机视觉与模式识别
2024-01-08 v1 人工智能
摘要
针对图像分类任务的后门攻击已被广泛研究并证明是成功的,但针对视觉-语言模型的后门攻击研究很少。本文通过污染训练数据探索针对图像描述模型的后门攻击。假设攻击者可以完全访问训练数据集,但不能干预模型构建或训练过程。具体地,随机选择一部分良性训练样本进行污染。然后,考虑到描述通常围绕图像中的对象展开,我们设计了一种面向对象的方法来制作毒样本,该方法旨在以与当前检测到的对象区域尺度成比例的修改数量,对像素值进行小幅修改。使用污染数据训练后,被攻击模型在良性图像上表现正常,但对于污染图像,模型将生成与给定图像无关的句子。该攻击在不牺牲良性测试图像生成性能的情况下,控制模型在特定测试图像上的行为。我们的方法证明了图像描述模型对后门攻击的脆弱性,希望这项工作能提高图像描述领域防御后门攻击的意识。
引用
@article{arxiv.2401.02600,
title = {Object-oriented backdoor attack against image captioning},
author = {Meiling Li and Nan Zhong and Xinpeng Zhang and Zhenxing Qian and Sheng Li},
journal= {arXiv preprint arXiv:2401.02600},
year = {2024}
}