中文

ProGuard:面向主动式多模态防护

计算机视觉与模式识别 2025-12-30 v1

摘要

生成模型的快速演进导致持续涌现多模态安全风险,暴露了现有防御方法的局限性。为应对这些挑战,我们提出ProGuard——一种视觉语言主动式防护机制,通过无需传统反应式方法所需模型调整的方式识别和描述超出分布(OOD)安全风险。首先,我们构建了一个包含87K个样本的模态平衡数据集,每个样本均在层次化多模态安全分类法下标注了二元安全标签和风险类别,从而有效缓解了模态偏差,确保文本、图像和文本-图像输入在情感表达上的一致性。基于该数据集,我们仅通过强化学习(RL)训练我们的视觉语言基础模型,以实现高效且简洁的推理。为在受控环境中模拟主动式安全场景,我们进一步引入ODD安全类别推理任务,并增强RL目标,引入基于同义词库的相似性奖励,以鼓励模型为 unseen 类别生成简洁的描述。实验结果表明,ProGuard在二元安全分类方面的性能相当于闭源大型模型,在不安全内容分类方面显著优于现有开源守卫模型。最突出的是,ProGuard展现出强大的主动式内容审核能力,将ODD风险检测提高52.6%,ODD风险描述提高64.8%。

关键词

引用

@article{arxiv.2512.23573,
  title  = {ProGuard: Towards Proactive Multimodal Safeguard},
  author = {Shaohan Yu and Lijun Li and Chenyang Si and Lu Sheng and Jing Shao},
  journal= {arXiv preprint arXiv:2512.23573},
  year   = {2025}
}