中文

PathMark:通过路径水印保护混合专家大语言模型的知识产权

密码学与安全 2026-07-04 v1

摘要

混合专家(MoE)大语言模型代表高价值知识产权,然而现有的为密集模型设计的水印方案因架构不匹配而无法在MoE架构上工作:传统方法假设水印参数被一致激活,但MoE的动态路由打破了这一假设。这也产生了两个关键漏洞:脆弱的决策边界和路由纠缠,其中集中的梯度会迅速覆盖签名。我们提出PathMark,第一个专门为MoE架构设计的水印框架,它通过主动将路由引导为隐蔽水印通道来反转这一范式。当触发时,PathMark主动约束所有令牌通过预定的专家子集路由,创建独特的路径签名。我们的设计通过三种机制直接解决这两个漏洞:(1)分布对齐损失将目标专家概率提升到主导水平,扩大针对扰动的决策边界;(2)宽路径配置在每层指定多个目标专家,确保更强的鲁棒性;(3)对比损失可证明地消除对干净输入的梯度泄漏,保持其自然路由路径。此外,PathMark通过组合路径自然支持多比特编码。通过白盒路由检查实现取证场景的验证,通过黑盒输出检测实现仅API访问的验证。在四个MoE模型上的实验表明,验证准确率超过>99%> 99\%,困惑度退化低于<2%< 2\%,并且在量化、微调、剪枝和自适应攻击下具有优越的鲁棒性。

关键词

引用

@article{arxiv.2607.03688,
  title  = {PathMark: Protecting Intellectual Property of Mixture-of-Expert LLMs via Path Watermarks},
  author = {Yudong Gao and Qingyue Wang and Yuanyuan Yuan and Ruixuan Huang and Linghan Chen and Zimo Ji and Shuai Wang},
  journal= {arXiv preprint arXiv:2607.03688},
  year   = {2026}
}

备注

20 pages, accepted by CCS'26