基于强化学习的文本到图像模型提示模板劫持
计算机视觉与模式识别
2025-10-02 v1 人工智能
摘要
多模态大语言模型(MLLMs)正在改变文本到图像工作流程,使设计师能够以前所未有的速度创建新颖的视觉概念。这一进步催生了活跃的提示交易市场,人们买卖能够诱导商标风格的精选提示。尽管具有商业吸引力,但提示交易也引入了 largely 未被充分考察的安全风险:提示本身可能被劫持。本文揭示了这一漏洞,并提出 RLStealer—a 基于强化学习的提示逆转框架,可仅通过少量示例图像即可恢复其模板。RLStealer 将模板劫持视为顺序决策问题,并运用多种基于相似性的反馈信号作为奖励函数,以有效探索提示空间。针对公开可用的基准进行全面实验表明,RLStealer 在性能上取得了最先进的水平,同时将总体攻击成本降低至现有基线的不到 13%。我们进一步的分析确认,RLStealer 能够有效地跨越不同的图像风格,高效地劫持未曾使用的提示模板。本研究凸显了提示交易中潜在的紧急安全威胁,为开发新兴 MLLMs 市场的保护标准奠定了基础。
引用
@article{arxiv.2510.00046,
title = {Reinforcement Learning-Based Prompt Template Stealing for Text-to-Image Models},
author = {Xiaotian Zou},
journal= {arXiv preprint arXiv:2510.00046},
year = {2025}
}
备注
10 pages, 3 figures