利用良性提示从文本到图像模型主动生成不安全图像
密码学与安全
2025-02-06 v2
摘要
已知恶意或经操纵的提示会利用文本到图像模型生成不安全图像。然而,现有研究侧重于对此类有害能力的被动利用。在本文中,我们研究通过恶意修改的文本到图像模型从良性提示(例如一张猫的照片)主动生成不安全图像。我们的初步调查表明,投毒攻击是实现此目标的可行方法,但揭示了显著的副作用,即对非目标提示的意外扩散损害了攻击的隐蔽性。根因分析确定概念相似性是导致这些副作用的一个重要因素。为此,我们提出了一种平衡隐蔽性与性能的隐蔽投毒攻击方法。我们的发现凸显了在现实场景采用文本到图像模型的潜在风险,从而呼吁该领域未来的研究与安全措施。
引用
@article{arxiv.2310.16613,
title = {On the Proactive Generation of Unsafe Images From Text-To-Image Models Using Benign Prompts},
author = {Yixin Wu and Ning Yu and Michael Backes and Yun Shen and Yang Zhang},
journal= {arXiv preprint arXiv:2310.16613},
year = {2025}
}
备注
To Appear in the 34th USENIX Security Symposium, August 13-15, 2025