SafeText:通过对齐文本编码器构建安全的文本到图像模型
密码学与安全
2025-03-03 v1 计算机视觉与模式识别
摘要
当面对不安全提示时,文本到图像模型可能会生成有害图像,从而带来重大的安全和社会风险。对齐方法旨在修改这些模型,以确保即使暴露于不安全提示时,它们也仅生成无害图像。典型的文本到图像模型包含两个主要组件:1)文本编码器和 2)扩散模块。现有的对齐方法主要集中在修改扩散模块以防止有害图像生成。然而,这通常会显著影响模型对安全提示的行为,导致生成图像的质量大幅下降。在这项工作中,我们提出了 SafeText,这是一种对齐文本编码器而非扩散模块的新型对齐方法。通过调整文本编码器,SafeText 显著改变了不安全提示的嵌入向量,同时对安全提示的嵌入向量影响极小。因此,扩散模块为不安全提示生成无害图像,同时保持安全提示的图像质量。我们在包含安全和不安全提示的多个数据集上评估了 SafeText,包括通过越狱攻击生成的提示。我们的结果表明,SafeText 有效地防止了有害图像的生成,且对安全提示的图像影响很小,并且 SafeText 优于六种现有的对齐方法。我们将在论文被接受后发布我们的代码和数据。
引用
@article{arxiv.2502.20623,
title = {SafeText: Safe Text-to-image Models via Aligning the Text Encoder},
author = {Yuepeng Hu and Zhengyuan Jiang and Neil Zhenqiang Gong},
journal= {arXiv preprint arXiv:2502.20623},
year = {2025}
}