大语言模型水印的统一攻击:未授权知识蒸馏中的欺骗与擦除
计算与语言
2025-08-26 v4
摘要
水印化已成为抵御误information和保护大语言模型 (LLMs) 知识产权的关键技术。近期发现,称为水印辐射的现象表明,水印嵌入在教师模型中的痕迹可通过知识蒸馏被继承到学生模型中。积极方面,这种继承允许通过识别学生模型中的水印痕迹来检测未授权的知识蒸馏。然而,针对擦除攻击的鲁棒性以及在未授权知识蒸馏下针对欺骗攻击的不可伪造性仍基本未探讨。现有水印攻击方法要么假设访问模型内部,要么无法同时支持擦除和欺骗攻击。本文提出了对比解码引导的知识蒸馿 (CDG-KD),一个实现未授权知识蒸馿下双向攻击的统一框架。我们的方法利用对比解码从学生模型和弱水印参考输出中提取被破坏或放大的水印文本,随后进行双向蒸馿以训练能够执行水印擦除和水印伪造的新学生模型。广泛的实验表明,CDG-KD 在保持蒸馿模型一般性能的同时有效执行攻击。我们的发现凸显了 developing robust and unforgeable watermarking schemes 的 critical need。
引用
@article{arxiv.2504.17480,
title = {Unified attacks to large language model watermarks: spoofing and scrubbing in unauthorized knowledge distillation},
author = {Xin Yi and Yue Li and Shunfan Zheng and Linlin Wang and Xiaoling Wang and Liang He},
journal= {arXiv preprint arXiv:2504.17480},
year = {2025}
}