PROMPTMINER:基于强化学习与 fuzz 优化的文本到图像生成模型黑盒提示词窃取
计算机视觉与模式识别
2025-12-01 v1
摘要
文本到图像(T2I)生成模型如Stable Diffusion和FLUX能够直接从文本提示词合成逼真、高质量的图像。图像质量高度依赖于精心设计的提示词,这些提示词既指定主体又指定风格修饰符,已成为宝贵的数字资产。然而,这些高质量提示词的日益增长的价值和普遍性暴露了它们的安全性和知识产权风险。一个关键威胁是提示词窃取,即从给定图像中恢复生成该图像的文本提示词的任务。提示词窃取可实现未经授权的提示词提取和重用,也可支持数据归因、模型源头分析和水印验证等有益应用。现有方法常常假设白盒梯度访问,或需要大规模标注数据集进行监督训练,或仅依赖描述符而无显式优化,限制了其实际可行性和适应性。为此,我们提出PROMPTMINER,一个黑盒提示词窃取框架,将该任务分解为两个阶段:(1)基于强化学习的优化阶段以重建主体;(2)基于 fuzz 的搜索阶段以恢复风格修饰符。跨多个数据集和扩散模型底层的实验表明,PROMPTMINER取得了优异的成绩,CLIP相似度达到0.958,基于SBERT的文本对齐度达到0.751,超越了所有基线。即使应用于来自未知生成器的野生图像,其CLIP相似度比最强基线高出7.5个百分点,显示出更好的泛化能力。最后,PROMPTMINER在防御性扰动下仍保持出色性能,显示出卓越的鲁棒性。代码:https://github.com/aaFrostnova/PromptMiner
引用
@article{arxiv.2511.22119,
title = {PROMPTMINER: Black-Box Prompt Stealing against Text-to-Image Generative Models via Reinforcement Learning and Fuzz Optimization},
author = {Mingzhe Li and Renhao Zhang and Zhiyang Wen and Siqi Pan and Bruno Castro da Silva and Juan Zhai and Shiqing Ma},
journal= {arXiv preprint arXiv:2511.22119},
year = {2025}
}