T2I-RiskyPrompt:面向文本到图像模型的安全评估、攻击与防御基准
密码学与安全
2025-11-24 v2 人工智能
计算机视觉与模式识别
摘要
使用风险文本提示(如色情和暴力提示)来测试文本到图像(T2I)模型的安全性是一个关键任务。然而,现有的风险提示数据集在三个关键方面受限:1)风险类别有限,2)注释粗粒度,3)有效性不足。为此,我们提出T2I-RiskyPrompt,一个为评估T2I模型安全相关任务而设计的综合基准。具体而言,我们首先开发了分层风险分类法,包含6个主要类别和14个细分子类别。基于该分类法,我们构建了一个收集和注释风险提示的管道。最终获得6,432个有效风险提示,其中每个提示都带有分层类别标签和详细风险原因。此外,为促进评估,我们提出了一种基于原因驱动的风险图像检测方法,显式地将多模态大语言模型与安全注释对齐。基于T2I-RiskyPrompt,我们对八个T2I模型、九种防御方法、五个安全过滤器和五种攻击策略进行了全面评估,提供了关于T2I模型安全的九个关键见解。最后,我们讨论了T2I-RiskyPrompt在多个研究领域的潜在应用。数据集和代码已提供于 https://github.com/datar001/T2I-RiskyPrompt。
引用
@article{arxiv.2510.22300,
title = {T2I-RiskyPrompt: A Benchmark for Safety Evaluation, Attack, and Defense on Text-to-Image Model},
author = {Chenyu Zhang and Tairen Zhang and Lanjun Wang and Ruidong Chen and Wenhui Li and Anan Liu},
journal= {arXiv preprint arXiv:2510.22300},
year = {2025}
}
备注
AAAI 2026