面向安全合成图像生成:基于多模态鲁棒 NSFW 防御及百万规模数据集
计算机视觉与模式识别
2025-04-17 v1 人工智能
摘要
过去几年里,我们见证了文本到图像(Text-to-Image,T2I)模型取得的显著性进展及其在网页上的广泛应用。大量研究致力于让 T2I 模型生成逼真的图像,带来了新的担忧,例如生成不适合工作(Not-Safe-For-Work,NSFW)网页内容,污染网页社会。为帮助防止 T2I 模型被滥用,为用户创造更安全的网页环境,常会采用诸如 NSFW 过滤器和事后安全检测等措施。然而,近期研究揭示了这些方法容易失败,从而无法防止滥用。特别是针对文本和图像模态的对抗攻击,能够轻易超越防御措施。%利用这种方式引发了日益增长的担忧,即防止针对文本和图像模态的对抗攻击。此外,目前尚无包含提示词与图像配对以及对抗样本的鲁棒多模态 NSFW 数据集。本工作提出了一个由开源扩散模型生成的百万规模提示词与图像数据集。其次,我们开发了一种多模态防御机制,用于区分安全与 NSFW 文本和图像,能够鲁棒地抵御对抗攻击,直接缓解当前挑战。我们的大量实验表明,在准确率和召回率方面,本方法对现有 SOTA NSFW 检测方法表现良好,显著降低了多模态对抗攻击情景下的攻击成功率(ASR)。代码:https://github.com/shahidmuneer/multimodal-nsfw-defense。
引用
@article{arxiv.2504.11707,
title = {Towards Safe Synthetic Image Generation On the Web: A Multimodal Robust NSFW Defense and Million Scale Dataset},
author = {Muhammad Shahid Muneer and Simon S. Woo},
journal= {arXiv preprint arXiv:2504.11707},
year = {2025}
}
备注
Short Paper The Web Conference