Safe-CLIP:从视觉-语言模型中移除 NSFW 概念
计算机视觉与模式识别
2024-07-25 v3 人工智能
计算与语言
多媒体
摘要
大规模视觉-语言模型,如 CLIP,通常在网络规模数据上训练,这可能引入不适当内容并导致不安全与有偏倚行为的产生。这反过来阻碍了它们在敏感和可信场景中的适用性,并可能在采用时引发重大关切。我们的研究引入了一种通过降低视觉-语言模型对 NSFW(不适合工作场所)输入的敏感性来增强其安全性的新方法。具体而言,我们的方法旨在切断“有毒”的语言和视觉概念,遗忘不安全语言或视觉项与嵌入空间不安全区域之间的关联。我们展示了如何通过对 CLIP 模型在合成数据上微调来实现这一点,该合成数据来自一个经训练可在安全与不安全句子间转换的大语言模型,以及一个文本到图像生成器。我们在所得嵌入空间上针对跨模态检索、文本到图像和图像到文本生成进行了大量实验,表明我们的模型可与预训练生成模型卓有成效地结合使用。我们的源代码和训练模型可在 https://github.com/aimagelab/safe-clip 获取。
引用
@article{arxiv.2311.16254,
title = {Safe-CLIP: Removing NSFW Concepts from Vision-and-Language Models},
author = {Samuele Poppi and Tobia Poppi and Federico Cocchi and Marcella Cornia and Lorenzo Baraldi and Rita Cucchiara},
journal= {arXiv preprint arXiv:2311.16254},
year = {2024}
}
备注
ECCV 2024