SafetyPairs:通过反事实图像生成隔离安全关键图像特征
计算机视觉与模式识别
2025-10-27 v1
摘要
特定图像究竟何为“不安全”?系统性地区分良性与问题图像具有挑战性,因为图像中细微的变化(如冒犯手势或符号)即可极大改变其安全含义。然而,现有图像安全数据集粗糙且模糊,仅提供宽泛的安全标签,而未隔离驱动这些差异的具体特征。我们提出了SafetyPairs——一个可扩展的框架,用于生成两幅仅在与给定安全策略相关的特征上有所不同的反事实图像对,从而翻转其安全标签。通过利用图像编辑模型,我们进行有针对性的修改,以改变图像的安全标签而不影响与安全无关的细节。使用SafetyPairs,我们构建了一个新的安全基准,该基准作为强大的评估数据来源,凸显了视觉语言模型在区分细微不同图像方面的弱点。除评估外,我们发现该管道也是有效的数据增强策略,可提高轻量级守卫模型的样本效率。我们发布的基准包含3020余幅SafetyPairs图像,涵盖9类安全类别的多样化分类,为研究细粒度图像安全差异提供了首个系统性资源。
引用
@article{arxiv.2510.21120,
title = {SafetyPairs: Isolating Safety Critical Image Features with Counterfactual Image Generation},
author = {Alec Helbling and Shruti Palaskar and Kundan Krishna and Polo Chau and Leon Gatys and Joseph Yitan Cheng},
journal= {arXiv preprint arXiv:2510.21120},
year = {2025}
}