针对文生图生成模型的提示词窃取攻击
密码学与安全
2024-04-16 v2 机器学习
摘要
文生图生成模型已彻底改变艺术设计流程,并使任何人都能通过输入称为提示词(prompt)的文本描述来创建高质量图像。创建一个由主体与若干修饰符组成的高质量提示词可能耗时且昂贵。因此,在专门市场上交易高质量提示词的趋势已经出现。本文首次开展研究以理解一种新型攻击的威胁,即提示词窃取攻击,其旨在从文生图生成模型所生成的图像中窃取提示词。成功的提示词窃取攻击直接侵犯提示词工程师的知识产权,并危及提示词市场的商业模式。我们首先对自行收集的数据集进行系统分析,表明成功的提示词窃取攻击应同时考虑提示词的主体及其修饰符。基于该观察,我们提出一种简单而有效的提示词窃取攻击 PromptStealer。它包含两个模块:经训练推断主体的主体生成器,以及用于识别生成图像中修饰符的修饰符检测器。实验结果表明,PromptStealer 在定量与定性上均优于三种基线方法。我们还对防御 PromptStealer 做出初步尝试。总体而言,我们的研究揭示了流行文生图生成模型所建立生态中的一种新攻击向量。我们希望我们的结果有助于理解并缓解这一新兴威胁。
引用
@article{arxiv.2302.09923,
title = {Prompt Stealing Attacks Against Text-to-Image Generation Models},
author = {Xinyue Shen and Yiting Qu and Michael Backes and Yang Zhang},
journal= {arXiv preprint arXiv:2302.09923},
year = {2024}
}