AEIOU:针对文本到图像模型中不适合工作提示的统一防御框架
密码学与安全
2025-12-10 v3 计算与语言
摘要
随着文本到图像(T2I)模型的进步和广泛采用,其相关的安全问题日益突出。恶意用户利用这些模型生成不适合工作(NSFW)图像,方法是使用有害或对抗性提示,这凸显了确保模型输出完整性和合规性的有效防护措施的必要性。然而,现有检测方法常表现出低准确率和低效性。本文提出 AEIOU,一个具有适应性、高效、可解释、可优化和统一性的防御框架,可针对 T2I 模型中的 NSFW 提示进行防御。AEIOU 从模型文本编码器的隐藏状态中提取 NSFW 特征,利用这些特征的可分离性来检测 NSFW 提示。检测过程高效,所需的推理时间最小。AEIOU 还提供实时结果解释,并支持通过数据增强技术进行优化。该框架通用,可适用于各种 T2I 架构。我们的广泛实验表明,AEIOU 在所有数据集上均显著优于商业和开源 moderation 工具,准确率超过 95%,效率至少提高十倍。它有效抵御自适应攻击,在零样本和多标签情景中表现出色。
引用
@article{arxiv.2412.18123,
title = {AEIOU: A Unified Defense Framework against NSFW Prompts in Text-to-Image Models},
author = {Yiming Wang and Jiahao Chen and Qingming Li and Tong Zhang and Rui Zeng and Xing Yang and Shouling Ji},
journal= {arXiv preprint arXiv:2412.18123},
year = {2025}
}