中文

守护文本到图像模型:针对白盒对手的防御

密码学与安全 2025-10-21 v1 计算机视觉与模式识别

摘要

文本到图像(Text-to-Image, T2I)模型虽然在图像生成方面展现出惊人的创造力,但可能被用于生成不安全的图像。现有的安全措施,如内容 moderation 或模型对齐,在面对了解并可调整模型参数的白盒对手时(例如通过微调)会失效。本文提出了一种新型防御框架,名为 Patronus,为 T2I 模型提供全方位防护,以抵御白盒对手。具体而言,我们设计了一个内部 moderator,将不安全的输入特征解码为零向量,同时确保良性输入特征的解码性能。此外,我们通过精心设计的不可微调学习机制加强了模型对齐,确保 T2I 模型不会因恶意微调而被破坏。我们进行了大量实验,验证了在安全内容生成方面的性能完整性以及对不安全内容生成的拒绝效果。结果也确认了 Patronus 对各种微调攻击的韧性,这些攻击均来自白盒对手。

关键词

引用

@article{arxiv.2510.16581,
  title  = {Patronus: Safeguarding Text-to-Image Models against White-Box Adversaries},
  author = {Xinfeng Li and Shengyuan Pang and Jialin Wu and Jiangyi Deng and Huanlong Zhong and Yanjiao Chen and Jie Zhang and Wenyuan Xu},
  journal= {arXiv preprint arXiv:2510.16581},
  year   = {2025}
}

备注

14 pages, 18 figures, 7 tables