中文

基于提示学习的视觉语言模型知识产权保护

计算机视觉与模式识别 2025-03-05 v1

摘要

诸如 CLIP(对比语言-图像预训练,Contrastive Language-Image Pre-Training)之类的视觉语言模型在视觉识别方面取得了显著成功,凸显了保护训练良好模型的知识产权(IP)的日益增长的需求。有效的 IP 保护不仅限于确保授权使用;它还需要将模型部署限制在授权数据域内,特别是当模型针对特定目标域进行微调时。然而,当前的 IP 保护方法通常仅依赖视觉骨干网络,这可能缺乏足够的语义丰富度。为了弥补这一差距,我们引入了 IP-CLIP,一种专为 CLIP 量身定制的轻量级 IP 保护策略,采用基于提示学习的方法。通过利用 CLIP 冻结的视觉骨干网络,我们提取图像风格和内容信息,并将它们纳入 IP 提示的学习中。该策略作为一道坚固的屏障,有效防止特征从授权域未经授权地转移到未授权域。此外,我们提出了一个风格增强分支,为授权和未授权域构建特征库。该分支整合了自增强和跨域特征,进一步增强了 IP-CLIP 阻止来自未授权域特征的能力。最后,我们提出了三个新的指标,旨在更好地平衡授权和未授权域的性能下降。在各种场景下的综合实验证明了其在 VLM 的 IP 保护任务中具有广阔的应用潜力。

关键词

引用

@article{arxiv.2503.02393,
  title  = {Vision-Language Model IP Protection via Prompt-based Learning},
  author = {Lianyu Wang and Meng Wang and Huazhu Fu and Daoqiang Zhang},
  journal= {arXiv preprint arXiv:2503.02393},
  year   = {2025}
}