中文

ShieldGemma 2:面向合成图像和自然图像的鲁棒且可计算的内容 moderation 模型

计算机视觉与模式识别 2025-04-10 v2 计算与语言 图像与视频处理

摘要

我们介绍 ShieldGemma 2,这是一个基于 Gemma 3 构建的 4B 参数图像内容 moderation 模型。该模型在以下关键伤害类别中提供稳健的安全风险预测:性显露、暴力与血腥、以及危险内容,适用于合成图像(如图像生成模型的输出)和自然图像(如输入到视觉语言模型的任何图像)。我们在内部和外部基准测试上进行评估,展示了相较于 LlavaGuard \citep{helff2024llavaguard}、GPT-4o mini \citep{hurst2024gpt} 以及基础 Gemma 3 模型 \citep{gemma_2025} 相比,ShieldGemma 2 在我们政策下的表现处于最先进水平。此外,我们提出了一种新颖的对抗性数据生成管道,能够实现受控、多样且稳健的图像生成。ShieldGemma 2 为多模态安全和负责任的人工智能开发提供了一个开放的图像 moderation 工具。

关键词

引用

@article{arxiv.2504.01081,
  title  = {ShieldGemma 2: Robust and Tractable Image Content Moderation},
  author = {Wenjun Zeng and Dana Kurniawan and Ryan Mullins and Yuchi Liu and Tamoghna Saha and Dirichi Ike-Njoku and Jindong Gu and Yiwen Song and Cai Xu and Jingjing Zhou and Aparna Joshi and Shravan Dheep and Mani Malek and Hamid Palangi and Joon Baek and Rick Pereira and Karthik Narasimhan},
  journal= {arXiv preprint arXiv:2504.01081},
  year   = {2025}
}