Instruct2Attack:语言引导的语义对抗攻击
计算机视觉与模式识别
2023-11-28 v1 人工智能
密码学与安全
机器学习
图像与视频处理
摘要
我们提出 Instruct2Attack (I2A),一种根据自由形式语言指令生成具有语义意义扰动的语言引导语义攻击。我们利用最先进的隐扩散模型,通过对反向扩散过程进行对抗性引导,在输入图像和文本指令的条件下搜索对抗性隐码。与现有的基于噪声和语义的攻击相比,I2A 生成更自然且多样的对抗样本,同时提供更好的可控性和可解释性。我们进一步利用 GPT-4 自动化攻击过程,生成多样的图像特定文本指令。我们表明,即使在强对抗防御下,I2A 也能成功攻破最先进的深度神经网络,并展示了在多种网络架构间的良好可迁移性。
引用
@article{arxiv.2311.15551,
title = {Instruct2Attack: Language-Guided Semantic Adversarial Attacks},
author = {Jiang Liu and Chen Wei and Yuxiang Guo and Heng Yu and Alan Yuille and Soheil Feizi and Chun Pong Lau and Rama Chellappa},
journal= {arXiv preprint arXiv:2311.15551},
year = {2023}
}
备注
under submission, code coming soon