面向政策自适应图像警戒:基准测试与方法
计算机视觉与模式识别
2026-04-01 v2
摘要
准确拒绝敏感或有害视觉内容(即有害图像警戒)是许多应用场景中的关键任务。该任务必须持续适应不同领域和随时间演变的安全政策和内容。然而,传统分类器局限于固定类别,需在引入新政策时频繁重新训练。视觉语言模型(VLM)为动态安全警戒提供了更具可适应性和可泛化性的基础。尽管如此,现有基于VLM的保护方法通常在仅固定安全政策下进行训练和评估。我们发现,这些模型对已见政策过度拟合,无法泛化到未见政策,甚至丧失基本的指令遵循能力和常识。为此,本文作出两个关键贡献。首先,我们构建SafeEditBench基准测试,对现有VLM的跨政策泛化性能进行评估。SafeEditBench利用图像编辑模型将不安全图像转换为安全图像,生成政策对齐的数据集,其中每个安全-不安全图像对在除特定安全规则局部区域外保持视觉相似性。人类标注员在五种不同政策下提供准确的安全/不安全标签,从而实现对政策感知泛化的细粒度评估。其次,我们引入SafeGuard-VL,一种基于强化学习的可验证奖励方法(RLVR),用于构建鲁棒的不安全图像警戒。SafeGuard-VL不依赖于固定政策下的监督微调(SFT),而是通过政策 grounding 奖励显式优化模型,促进跨演化政策的可验证适应。大量实验验证了我们方法在各种政策下处理不安全图像警戒的有效性。
引用
@article{arxiv.2603.01228,
title = {Towards Policy-Adaptive Image Guardrail: Benchmark and Method},
author = {Caiyong Piao and Zhiyuan Yan and Haoming Xu and Yunzhen Zhao and Kaiqing Lin and Feiyang Xu and Shuigeng Zhou},
journal= {arXiv preprint arXiv:2603.01228},
year = {2026}
}