中文

基于零空间的语言模型黑箱水印防御框架 NSmark

密码学与安全 2025-02-04 v2 人工智能 计算与语言

摘要

语言模型 (LM) 已成为至关重要的知识产权 (IP) 资产,亟需受到保护。尽管已提出多种水印策略,但它们仍 vulnerable to 线性功能等价攻击 (LFEA),该攻击无需了解水印方案或训练数据即可使大多数现有白盒水印失效。本文分析并扩展了 LFEA 的攻击场景,使其适用于语言模型常见的黑箱设置中,称为 LL-LFEA。我们发现,输出矩阵的零空间在 LL-LFEA 攻击下保持不变。基于此,我们提出了 NSmark,一种任务无关且 capable of 抗抗 LL-LFEA 攻击的黑箱水印方案。NSmark 包含三个阶段:(i) 利用所有者的数字签名生成水印,通过扩频调制提高鲁棒性;(ii) 通过输出映射提取器嵌入水印,该提取器在保持 LM 性能的同时最大化水印容量;(iii) 水印验证,通过提取率和零空间一致性评估。在预训练和下游任务上的大量实验表明,该方法有效、可扩展、可靠、保真且鲁棒。代码已公开 https://github.com/dongdongzhaoUP/NSmark。

关键词

引用

@article{arxiv.2410.13907,
  title  = {NSmark: Null Space Based Black-box Watermarking Defense Framework for Language Models},
  author = {Haodong Zhao and Jinming Hu and Peixuan Li and Fangqi Li and Jinrui Sha and Tianjie Ju and Peixuan Chen and Zhuosheng Zhang and Gongshen Liu},
  journal= {arXiv preprint arXiv:2410.13907},
  year   = {2025}
}

备注

In progress