中文

ShieldGemma:基于 Gemma 的生成式 AI 内容审核

计算与语言 2024-08-06 v2 机器学习

摘要

我们提出 ShieldGemma,这是一个建立在 Gemma2 之上的综合性 LLM-based 安全内容审核模型套件。这些模型在用户输入和 LLM 生成的输出中,对关键伤害类型(如性暴露、危险内容、骚扰、仇恨言论)提供稳健且领先的预测。我们在公共基准和内部基准上进行评估,展示了相较于现有模型(如 Llama Guard 在公共基准上提升了10.8% AU-PRC,WildCard 提升了4.3%)表现卓越。此外,我们提出了一种新颖的 LLM-based 数据 curated pipeline,可适用于各种安全相关任务。我们展示了主要在合成数据上训练的模型具有强大的泛化性能。通过发布 ShieldGemma,我们为研究社区提供了宝贵资源,推动了 LLM 安全的进步,使开发者能够创建更有效的内容审核解决方案。

关键词

引用

@article{arxiv.2407.21772,
  title  = {ShieldGemma: Generative AI Content Moderation Based on Gemma},
  author = {Wenjun Zeng and Yuchi Liu and Ryan Mullins and Ludovic Peran and Joe Fernandez and Hamza Harkous and Karthik Narasimhan and Drew Proud and Piyush Kumar and Bhaktipriya Radharapu and Olivia Sturman and Oscar Wahltinez},
  journal= {arXiv preprint arXiv:2407.21772},
  year   = {2024}
}