LlavaGuard:一个基于VLM的开放框架,用于保护视觉数据集和模型
计算机视觉与模式识别
2025-06-09 v3 人工智能
机器学习
摘要
本文介绍了LlavaGuard,一套基于VLM的视觉安全防护工具,解决了大规模数据和模型时代对可靠护栏的关键需求。为此,我们建立了一个新颖的开放框架,描述了可定制的安全分类法、数据预处理、增强和训练设置。为了教导VLM安全防护,我们进一步创建了一个多模态安全数据集,包含高质量的人类专家标注,其中每张图像都标注了安全评级、类别和理由。我们还采用了高级增强来支持特定上下文的评估。由此产生的LlavaGuard模型,范围从0.5B到7B,可作为评估视觉内容是否符合灵活策略的通用工具。在全面实验中,LlavaGuard在准确性和灵活处理不同策略方面均优于最先进的安全防护和VLM。此外,我们展示了LlavaGuard在两个实际应用中的性能:大规模数据集标注和文本到图像模型的审核。我们公开了整个框架,包括数据集、模型权重和训练代码。
引用
@article{arxiv.2406.05113,
title = {LlavaGuard: An Open VLM-based Framework for Safeguarding Vision Datasets and Models},
author = {Lukas Helff and Felix Friedrich and Manuel Brack and Kristian Kersting and Patrick Schramowski},
journal= {arXiv preprint arXiv:2406.05113},
year = {2025}
}
备注
In Proceedings of the 42st International Conference on Machine Learning (ICML 2025), Project page at https://ml-research.github.io/human-centered-genai/projects/llavaguard/index.html