中文

SWAP:通过顺序水印实现软提示版权审计

密码学与安全 2026-05-27 v2 人工智能 机器学习

摘要

大规模视觉语言模型,尤其是CLIP,已在多样化下游任务中展现出卓越性能。软提示作为精心设计的模块,高效地将视觉语言模型适应于特定任务,亟需有效的版权保护。本文研究通过审计第三方模型是否包含受保护的软提示来实现模型版权保护。虽然这可被视为模型所有权审计的一种特殊情况,但我们的分析表明,现有技术因提示学习的独特特征而无效。非侵入式审计在独立模型与受害模型共享相似数据分布时,易产生误报。侵入式方法也失败了:为CLIP设计的后门方法无法嵌入功能性触发器,而将传统DNN后门技术扩展到提示学习则因危害性和模糊性挑战而受限。我们发现,这些侵入式审计的失败源于同一根本原因:水印在主要任务所处的同一决策空间中运作,却追求对立目标。灵感来自于这些发现,我们提出了软提示的顺序水印(SWAP),通过将水印嵌入更复杂的空间来实现。SWAP通过特定的防御者指定的超分布类顺序来编码水印,受益于CLIP的零样图预测能力。这一水印嵌入更复杂的空间,保持原始预测标签不变,使其不再与主要任务相互冲突。我们进一步设计了基于假设检验的验证协议,并对SWAP的何时有效性进行了理论分析。广泛的实验在11个数据集上表明,SWAP在有效性、无害性和抗攻击鲁棒性方面均表现出色。

关键词

引用

@article{arxiv.2511.04711,
  title  = {SWAP: Towards Copyright Auditing of Soft Prompts via Sequential Watermarking},
  author = {Wenyuan Yang and Yichen Sun and Changzheng Chen and Zhixuan Chu and Jiaheng Zhang and Yiming Li and Dacheng Tao},
  journal= {arXiv preprint arXiv:2511.04711},
  year   = {2026}
}

备注

This paper has been accepted by the International Journal of Computer Vision (IJCV), 2026. The first two authors contributed equally to this work. 28 pages