中文

Holmes:基于解耦公共特征的面向个性化大视觉模型的有效无害模型所有权验证

计算机视觉与模式识别 2025-12-22 v2 人工智能

摘要

大视觉模型(Large Vision Models, LVMs)在各种下游任务中取得了显著性能,主要通过对预训练模型进行微调(fine-tuning)并结合私有且珍贵的本地数据来实现个性化,从而使个性化模型成为宝贵的知识产权。类似传统深度神经网络时代,模型窃取攻击也对 LVMs 构成重要风险。然而,本文发现大多数现有防御方法(为传统 DNN 设计),通常为从头训练的模型所设计,要么引入额外的安全风险,要么容易产生误判,要么甚至对微调后的模型无效。为缓解这些问题,本文提出一种通过解耦类似的公共特征来实现对个性化 LVMs 的无害模型所有权验证的方法。总体而言,我们的方法包含三个主要阶段。第一阶段,我们创建影子模型(shadow models),保留受害者模型的公共特征,同时扰乱数据集特定特征。我们通过计算影子模型与受害者模型之间的输出差异来表示受害者模型的数据集特定特征,而无需改变受害者模型或其训练过程。随后,训练一个元分类器(meta-classifier)以确定可疑模型是否包含受害者模型的数据集特定特征。第三阶段,我们通过假设检验进行模型所有权验证,以减轻随机性并提高鲁棒性。大量实验在基准数据集上验证了所提方法在检测多种类型模型窃取方面的有效性。我们的代码已公开于 https://github.com/zlh-thu/Holmes。

关键词

引用

@article{arxiv.2507.00724,
  title  = {Holmes: Towards Effective and Harmless Model Ownership Verification to Personalized Large Vision Models via Decoupling Common Features},
  author = {Linghui Zhu and Yiming Li and Haiqin Weng and Yan Liu and Tianwei Zhang and Shu-Tao Xia and Zhi Wang},
  journal= {arXiv preprint arXiv:2507.00724},
  year   = {2025}
}