中文

真实灰盒假设下多模态模型的对抗评估

计算机视觉与模式识别 2021-06-10 v3 人工智能 密码学与安全

摘要

本研究考察了多模态(图像+文本)模型对对抗威胁的脆弱性,此类威胁类似于先前文献中针对单模态(仅图像或仅文本)模型所讨论的那些。我们引入关于部分模型知识与访问权限的真实假设,并讨论这些假设如何不同于当前对抗攻击文献中标准的“黑盒”/“白盒”二分法。在各种程度的这些“灰盒”假设下工作,我们开发了专属于多模态分类的新攻击方法,并在 Hateful Memes Challenge 分类任务上对其进行了评估。我们发现攻击多个模态比单独的单模态攻击更强(在多达 73% 的案例中引发错误),并且我们所探索的对多模态分类器的单模态图像攻击强于基于字符的文本增强攻击(分别平均在 45% 和 30% 的案例中引发错误)。

关键词

引用

@article{arxiv.2011.12902,
  title  = {Adversarial Evaluation of Multimodal Models under Realistic Gray Box Assumption},
  author = {Ivan Evtimov and Russel Howes and Brian Dolhansky and Hamed Firooz and Cristian Canton Ferrer},
  journal= {arXiv preprint arXiv:2011.12902},
  year   = {2021}
}