中文

MMCert:针对多模态模型对抗攻击的可证明防御

计算机视觉与模式识别 2024-04-03 v3 密码学与安全

摘要

与输入来自单一模态的单模态模型不同,多模态模型的输入(称为多模态输入)来自多个模态,如图像、3D 点、音频、文本等。与单模态模型类似,许多现有研究表明,多模态模型也容易受到对抗扰动攻击,攻击者可以向多模态输入的所有模态添加微小扰动,使得多模态模型对其做出错误预测。现有的认证防御大多是为单模态模型设计的,如我们的实验结果所示,将其扩展到多模态模型时只能取得次优的认证鲁棒性保证。在我们的工作中,我们提出了 MMCert,这是首个针对多模态模型对抗攻击的认证防御。我们推导出了在针对两种模态具有有限扰动(例如,在自动驾驶场景下,我们限定 RGB 图像和深度图像中改变的像素数量)的任意对抗攻击下,MMCert 性能的下界。我们使用两个基准数据集评估了 MMCert:一个用于多模态道路分割任务,另一个用于多模态情感识别任务。此外,我们将 MMCert 与从单模态模型扩展而来的 state-of-the-art 认证防御进行了比较。我们的实验结果表明,我们的 MMCert 优于基线方法。

关键词

引用

@article{arxiv.2403.19080,
  title  = {MMCert: Provable Defense against Adversarial Attacks to Multi-modal Models},
  author = {Yanting Wang and Hongye Fu and Wei Zou and Jinyuan Jia},
  journal= {arXiv preprint arXiv:2403.19080},
  year   = {2024}
}

备注

To appear in CVPR'24