基于高熵直通层的任务无关语言模型水印
计算与语言
2024-12-18 v1
摘要
在大语言模型预训练成本高昂的时代,确保模型所有者的知识产权并保证上述模型被负责任地部署正变得越来越重要。为此,我们提出通过直通层进行模型水印,这些层被添加到现有的预训练网络中,并使用自监督损失进行训练,使得模型在输入唯一私钥时产生高熵输出,而在其他情况下表现正常。与现有的模型水印方法不同,我们的方法完全任务无关,可应用于分类和序列到序列任务,而无需对下游微调数据集的高级访问权限。我们在广泛的下游任务上评估了所提出的直通层,并实验表明,我们的水印方法在大多数情况下实现了近乎完美的水印提取准确率和假阳性率,且未损害原始模型性能。此外,我们证明该方法对下游微调、精细剪枝和层移除攻击均具有鲁棒性,且其训练时间仅需原始模型训练时间的一小部分。论文中提供了代码。
引用
@article{arxiv.2412.12563,
title = {Task-Agnostic Language Model Watermarking via High Entropy Passthrough Layers},
author = {Vaden Masrani and Mohammad Akbari and David Ming Xuan Yue and Ahmad Rezaei and Yong Zhang},
journal= {arXiv preprint arXiv:2412.12563},
year = {2024}
}
备注
Accepted to AAAI2025