DREAM:基于分布建模的可扩展文本到图像生成系统红队测试
密码学与安全
2025-12-09 v2 人工智能
计算机视觉与模式识别
摘要
尽管集成了安全对齐和外部过滤器,文本到图像(T2I)生成系统仍易产生有害内容,如色情或暴力图像。这引发了对意外暴露和潜在滥用的严重担忧。红队测试旨在主动识别可使T2I系统输出不安全内容的多样化提示,日益被视为在真实部署前评估和改进安全性的重要方法。然而,现有的自动化红队测试方法通常将提示发现视为孤立的、提示级别的优化任务,这限制了其可扩展性、多样性和整体有效性。为弥补这一差距,本文提出DREAM,一个可扩展的红队测试框架,用于自动从给定T2I系统中发现多样化的问题提示。与先前单独优化提示的工作不同,DREAM直接对目标系统问题提示的概率分布进行建模,从而能够对有效性和多样性进行显式优化,并允许在训练后进行高效的大规模采样。为在无法直接获取代表性训练样本的情况下实现这一点,我们从基于能量的模型中汲取灵感,将目标重新表述为简单且易于处理的形式。我们进一步引入GC-SPSA,一种高效优化算法,通过长且潜在不可微的T2I流水线提供稳定的梯度估计。在推理阶段,我们还提出了一种多样性感知采样策略以增强提示多样性。通过广泛实验验证了DREAM的有效性,在广泛的T2I模型和安全过滤器上展示了在提示成功率和多样性方面的SOTA性能。代码可在https://github.com/AntigoneRandy/DREAM获取
引用
@article{arxiv.2507.16329,
title = {DREAM: Scalable Red Teaming for Text-to-Image Generative Systems via Distribution Modeling},
author = {Boheng Li and Junjie Wang and Yiming Li and Zhiyang Hu and Leyi Qi and Jianshuo Dong and Run Wang and Han Qiu and Zhan Qin and Tianwei Zhang},
journal= {arXiv preprint arXiv:2507.16329},
year = {2025}
}
备注
To appear in the IEEE Symposium on Security & Privacy, May 2026