中文

通过可微模型合并实现多概念模型免疫化

计算机视觉与模式识别 2024-12-23 v1

摘要

模型免疫化是一个新兴方向,旨在缓解开源模型与先进适应方法相关的滥用风险。其思想是使发布的模型权重难以针对某些有害应用进行微调,从而命名为"已免疫"。最近的模型免疫化工作集中于单概念情境。然而,在现实情况下,需要针对多个概念对模型进行免疫化。为此,我们提出一种免疫算法,同时学习一组概念上的单一"困难初始化"以适应各种方法。我们通过纳入一种可微合并层来实现这一点,该层组合了针对多个概念适应的模型权重。在实验中,我们通过将先前工作的再学习和个人化适应实验设置推广到多个概念,展示了多概念免疫化的有效性。

关键词

引用

@article{arxiv.2412.15320,
  title  = {Multi-concept Model Immunization through Differentiable Model Merging},
  author = {Amber Yijia Zheng and Raymond A. Yeh},
  journal= {arXiv preprint arXiv:2412.15320},
  year   = {2024}
}

备注

AAAI 2025