中文

Google的Bard对对抗图像攻击的鲁棒性如何?

计算机视觉与模式识别 2023-10-17 v2 人工智能 密码学与安全 机器学习

摘要

集成文本与其他模态(尤其是视觉)的多模态大语言模型(MLLMs)在各种多模态任务中取得了前所未有的性能。然而,由于视觉模型的对抗鲁棒性问题尚未解决,引入视觉输入会使MLLMs面临更严峻的安全与安保风险。本工作中,我们研究了Google的Bard(近期发布多模态能力、可与ChatGPT竞争的聊天机器人)的对抗鲁棒性,以更好地理解商业MLLMs的漏洞。通过攻击白盒代理视觉编码器或MLLMs,生成的对抗样本仅基于可迁移性即可误导Bard输出错误的图像描述,成功率达22%。我们表明这些对抗样本也能攻击其他MLLMs,例如对Bing Chat的攻击成功率为26%,对ERNIE bot为86%。此外,我们识别出Bard的两种防御机制,包括人脸检测与图像毒性检测。我们设计了相应攻击以规避这些防御,表明Bard当前的防御同样脆弱。我们希望本工作能深化对MLLMs鲁棒性的理解并促进未来的防御研究。我们的代码见https://github.com/thu-ml/Attack-Bard。更新:GPT-4V于2023年10月可用。我们在同一组对抗样本下进一步评估其鲁棒性,攻击成功率达45%。

关键词

引用

@article{arxiv.2309.11751,
  title  = {How Robust is Google's Bard to Adversarial Image Attacks?},
  author = {Yinpeng Dong and Huanran Chen and Jiawei Chen and Zhengwei Fang and Xiao Yang and Yichi Zhang and Yu Tian and Hang Su and Jun Zhu},
  journal= {arXiv preprint arXiv:2309.11751},
  year   = {2023}
}

备注

Technical report