基于对抗性误标注的文本到图像 AI 模型投毒可行性研究
密码学与安全
2025-06-30 v1 人工智能
摘要
当今的文本到图像生成模型依赖来自互联网的数百万图像,每张图像配有由视觉语言模型 (VLM) 产生的详细描述。该训练管道对于提供大量高质量图像-文本对至关重要。然而,近期研究表明 VLM 易受到隐蔽对抗性攻击的威胁,攻击者可通过对图像添加对抗性扰动,误导 VLM 生成错误的描述。在本文中,我们探讨了将对抗性误标注攻击作为文本到图像模型训练管道投毒机制的可行性。我们的实验表明,VLM 对对抗性扰动极其脆弱,攻击者可生成外观良好的图像,使其被 VLM 模型一致性误标。这相当于将强大的“脏标签”投毒样本注入文本到图像模型的训练管道,用少量投毒样本即可成功改变模型行为。我们发现,虽然某些潜在防御措施有效,但可被适应性攻击者针对性地规避。这表明可能出现数据质量下降和文本到图像模型开发成本增加的“猫鼠游戏”。最后,我们在实际场景中展示了这些攻击的有效性,即使在针对商业 VLM(如 Google Vertex AI 和 Microsoft Azure)的黑盒场景下,也能实现超过 73% 的高攻击成功率。
引用
@article{arxiv.2506.21874,
title = {On the Feasibility of Poisoning Text-to-Image AI Models via Adversarial Mislabeling},
author = {Stanley Wu and Ronik Bhaskar and Anna Yoo Jeong Ha and Shawn Shan and Haitao Zheng and Ben Y. Zhao},
journal= {arXiv preprint arXiv:2506.21874},
year = {2025}
}
备注
ACM Conference on Computer and Communications Security 2025