UnsafeBench:在真实图像和 AI 生成图像上的图像安全分类器基准测试
密码学与安全
2025-09-12 v3 计算机视觉与模式识别
社会与信息网络
摘要
随着文本到图像模型的出现以及滥用 concerns 的增加,开发者越来越依赖图像安全分类器来审管其生成的不安全图像。然而,当前图像安全分类器在真实图像和 AI 生成图像上的性能尚未知晓。本文提出 UnsafeBench,一个评估图像安全分类器有效性和鲁棒性的基准框架,特别关注 AI 生成图像对其性能的影响。首先,我们策划了包含 10K 张真实图像和 AI 生成图像的数据集,这些图像根据 11 项不安全类别(如性、暴力、仇恨等)进行了安全/不安全标注。随后,我们评估了五大流行图像安全分类器以及三个由通用视觉语言模型驱动的分类器的有效性和鲁棒性。我们的评估表明,现有图像安全分类器在全面性和有效性方面尚不足以缓解不安全图像的多维问题。此外,真实图像和 AI 生成图像在图像质量、风格和布局方面存在分布偏移,导致其有效性和鲁棒性下降。针对这些发现,我们构建了一个全面的图像 moderation 工具,称为 PerspectiveVision,它改进了现有分类器的有效性和鲁棒性,尤其是在 AI 生成图像方面。UnsafeBench 和 PerspectiveVision 可帮助研究社区更好地理解生成式 AI 时代图像安全分类的格局。
引用
@article{arxiv.2405.03486,
title = {UnsafeBench: Benchmarking Image Safety Classifiers on Real-World and AI-Generated Images},
author = {Yiting Qu and Xinyue Shen and Yixin Wu and Michael Backes and Savvas Zannettou and Yang Zhang},
journal= {arXiv preprint arXiv:2405.03486},
year = {2025}
}
备注
To Appear in the ACM Conference on Computer and Communications Security (CCS), October 13, 2025