PathMark:通过路径水印保护混合专家大语言模型的知识产权
密码学与安全
2026-07-04 v1
摘要
混合专家(MoE)大语言模型代表高价值知识产权,然而现有的为密集模型设计的水印方案因架构不匹配而无法在MoE架构上工作:传统方法假设水印参数被一致激活,但MoE的动态路由打破了这一假设。这也产生了两个关键漏洞:脆弱的决策边界和路由纠缠,其中集中的梯度会迅速覆盖签名。我们提出PathMark,第一个专门为MoE架构设计的水印框架,它通过主动将路由引导为隐蔽水印通道来反转这一范式。当触发时,PathMark主动约束所有令牌通过预定的专家子集路由,创建独特的路径签名。我们的设计通过三种机制直接解决这两个漏洞:(1)分布对齐损失将目标专家概率提升到主导水平,扩大针对扰动的决策边界;(2)宽路径配置在每层指定多个目标专家,确保更强的鲁棒性;(3)对比损失可证明地消除对干净输入的梯度泄漏,保持其自然路由路径。此外,PathMark通过组合路径自然支持多比特编码。通过白盒路由检查实现取证场景的验证,通过黑盒输出检测实现仅API访问的验证。在四个MoE模型上的实验表明,验证准确率超过,困惑度退化低于,并且在量化、微调、剪枝和自适应攻击下具有优越的鲁棒性。
引用
@article{arxiv.2607.03688,
title = {PathMark: Protecting Intellectual Property of Mixture-of-Expert LLMs via Path Watermarks},
author = {Yudong Gao and Qingyue Wang and Yuanyuan Yuan and Ruixuan Huang and Linghan Chen and Zimo Ji and Shuai Wang},
journal= {arXiv preprint arXiv:2607.03688},
year = {2026}
}
备注
20 pages, accepted by CCS'26