中文

SafeVision:高效图像警戒,具备稳健政策遵循性与可解释性

计算机视觉与模式识别 2025-10-29 v1 人工智能 密码学与安全

摘要

随着数字媒体的快速传播,对高效且透明地防御不安全内容的需求日益紧迫。传统图像警戒模型受限于预定义类别,纯基于特征的学习缺乏语义推理,常因误分类。此外,这些模型难以适应新兴威胁,需要昂贵的重新训练。为此,我们提出 SafeVision,一种集成类人推理的新型图像警戒,以提升适应性和透明性。我们的方法包含有效的数据收集与生成框架、政策遵循的训练管道以及定制化损失函数。我们还提出多样化 QA 生成与训练策略以提升学习效果。SafeVision 在推理时能动态对齐不断演变的安全政策,无需重新训练,即可实现精准风险评估与解释。鉴于现有不安全图像基准数据集要么缺乏细粒度,要么覆盖风险有限,我们引入 VisionHarm 数据集,其包含两个子集:VisionHarm Third-party(VisionHarm-T)与 VisionHarm Comprehensive(VisionHarm-C),涵盖多样有害类别。通过大量实验,我们表明 SafeVision 在不同基准上实现领先性能。SafeVision 在 VisionHarm-T 上的性能比 GPT-4o 高出 8.6%,在 VisionHarm-C 上高出 15.5%,且速度超 16 倍。SafeVision 建立了一个全面、遵循政策、可解释且具动态适应新兴威胁能力的数字图像警戒系统。

关键词

引用

@article{arxiv.2510.23960,
  title  = {SafeVision: Efficient Image Guardrail with Robust Policy Adherence and Explainability},
  author = {Peiyang Xu and Minzhou Pan and Zhaorun Chen and Shuang Yang and Chaowei Xiao and Bo Li},
  journal= {arXiv preprint arXiv:2510.23960},
  year   = {2025}
}

备注

42 pages, 9 figures