中文

TIJO:基于联合优化的触发反转以防御多模态后门模型

计算机视觉与模式识别 2023-08-09 v1

摘要

我们提出一种多模态后门防御技术 TIJO(使用联合优化的触发反转,Trigger Inversion using Joint Optimization)。近期工作 arXiv:2112.07668 展示了对视觉问答任务多模态模型的成功后门攻击。其双密钥后门触发器跨两种模态(图像与文本)拆分,仅当触发器同时存在于两种模态中时后门才被激活。我们提出 TIJO,通过联合优化在图像与文本模态中反向工程该触发器,从而防御双密钥攻击。由于视觉流水线由离线特征提取器及其后与文本通过融合模块融合的输出构成,二者不连通,这种联合优化在多模态模型中颇具挑战。TIJO 中实现联合优化的关键洞见是,触发反转需在目标检测框特征空间而非像素空间中进行。我们在 TrojVQA 基准上证明了方法的有效性,TIJO 将多模态双密钥后门上的 SOTA 单模态方法从 AUC 0.6 提升至 0.92。此外,我们的方法在单模态后门上也优于单模态基线。我们给出消融研究与定性结果,以深入剖析算法,例如反转特征触发器在触发反转期间叠加于所有视觉特征上的关键重要性。TIJO 的原型实现见 https://github.com/SRI-CSL/TIJO。

关键词

引用

@article{arxiv.2308.03906,
  title  = {TIJO: Trigger Inversion with Joint Optimization for Defending Multimodal Backdoored Models},
  author = {Indranil Sur and Karan Sikka and Matthew Walmer and Kaushik Koneripalli and Anirban Roy and Xiao Lin and Ajay Divakaran and Susmit Jha},
  journal= {arXiv preprint arXiv:2308.03906},
  year   = {2023}
}

备注

Published as conference paper at ICCV 2023. 13 pages, 6 figures, 7 tables