中文

Stealix:基于 Prompt 进化的数据模型窃取

密码学与安全 2025-06-09 v1 机器学习

摘要

模型窃取是机器学习中的重要安全风险,允许攻击者在没有访问训练数据的情况下复制黑箱模型,从而危及知识产权并暴露敏感信息。最近的一些方法利用预训练扩散模型进行数据合成,提高了效率和性能,但高度依赖手动设计的提示词,这限制了自动化和可扩展性,尤其是对于缺乏专业知识的攻击者而言。为评估开源预训练模型所带来的风险,我们提出了更真实的威胁模型,无需提示词设计技能或类名知识。在此背景下,我们提出Stealix,这是首个无需预定义提示词即可进行模型窃取的方法。Stealix使用两个开源预训练模型来推断受害模型的数据分布,通过遗传算法迭代细化提示词,逐步提高合成图像的精确度和多样性。我们的实验结果表明,Stealix在相同查询预算下显著优于其他方法,哪怕这些方法拥有类名或细粒度提示词。这些发现凸显了该方法的可扩展性,并表明预训练生成模型在模型窃取中的风险可能比此前认识的更大。

关键词

引用

@article{arxiv.2506.05867,
  title  = {Stealix: Model Stealing via Prompt Evolution},
  author = {Zhixiong Zhuang and Hui-Po Wang and Maria-Irina Nicolae and Mario Fritz},
  journal= {arXiv preprint arXiv:2506.05867},
  year   = {2025}
}

备注

Accepted at ICML 2025. The project page is at https://zhixiongzh.github.io/stealix/