SafeR-CLIP:在保持预训练知识的同时缓解视觉语言模型中的 NSFW 内容
计算机视觉与模式识别
2025-11-24 v1 人工智能
机器学习
摘要
通过微调提高像 CLIP 这样的视觉语言模型的安全性往往会导致其泛化性能显著下降。我们发现,这一权衡源于强制将不安全概念对准单个预定义安全目标的刚性对齐策略,这会破坏模型所学习的语义结构。为此,我们提出一种 proximity-aware 方法:将不安全概念重新定向到其语义上最近的安全替代方案,以最小化表示性变化。我们引入 SaFeR-CLIP,这是一个应用该最小干预原则的微调框架。SaFeR-CLIP 成功实现了安全性和性能之间的和解,使先前方法的零样本准确率提升最高可达 8.0%,同时保持稳健的安全性。为支持更严格的评估,我们还贡献了 NSFW-Caps,这是一个用于测试在分布迁移下的安全性的新的 1000 对高度对齐的基准。我们工作表明,尊重预训练表示的几何结构是实现在不牺牲性能方面实现安全性的关键。
引用
@article{arxiv.2511.16743,
title = {SafeR-CLIP: Mitigating NSFW Content in Vision-Language Models While Preserving Pre-Trained Knowledge},
author = {Adeel Yousaf and Joseph Fioresi and James Beetham and Amrit Singh Bedi and Mubarak Shah},
journal= {arXiv preprint arXiv:2511.16743},
year = {2025}
}
备注
AAAI 2026 (Main Technical Track)