面向安全文本到图像生成的 PurifyGen:风险判别与语义净化模型
计算机视觉与模式识别
2025-12-30 v1
摘要
扩散模型的近期进展显著提升了文本到图像(T2I)生成质量,但也带来了生成不安全内容的风险。传统的安全方法,如文本黑名单或有害内容分类,存在显著缺点:容易被规避,或需要大量数据集和额外训练。为克服这些挑战,我们引入PurifyGen,一种全新的、无需训练的安全 T2I 生成方法,保留模型的原始权重。PurifyGen 提出一种双阶段策略进行提示词净化。首先,我们通过计算每个提示词与预定义有毒和干净概念嵌入之间的补充语义距离来评估提示词中每个 token 的安全性,该距离衡量提示词 token 与有毒和干净概念嵌入之间的语义接近程度。这使我们能够在无需显式关键词匹配或重新训练的情况下进行细粒度的提示词分类。接近有毒概念的 token 被标记为高风险。其次,对于高风险提示词,我们应用一种双空间转换:将有毒对齐的嵌入投影到有毒概念矩阵的零空间,从而有效移除有害语义组件,同时将其对齐到干净概念的范围空间。这一双重对齐通过减去不安全的语义并强化安全的语义来净化高风险提示词,同时保留原始意图和连贯性。我们进一步定义了一种按 token 的策略,用于选择性替换仅高风险 token 的嵌入,以确保对安全内容的最小干扰。PurifyGen 提供了一个即插即用的解决方案,具备理论依据并对未见提示词和模型具有强大的概括能力。广泛的测试表明,PurifyGen 在五个数据集上优于当前方法,能够有效降低不安全内容的生成,同时与需要训练的方法相比性能相当。代码可参考 https://github.com/AI-Researcher-Team/PurifyGen。
引用
@article{arxiv.2512.23546,
title = {PurifyGen: A Risk-Discrimination and Semantic-Purification Model for Safe Text-to-Image Generation},
author = {Zongsheng Cao and Yangfan He and Anran Liu and Jun Xie and Feng Chen and Zepeng Wang},
journal= {arXiv preprint arXiv:2512.23546},
year = {2025}
}