沙中之水印:生成模型强水印的不可能性
机器学习
2025-05-29 v5 计算与语言
密码学与安全
摘要
对生成模型加水印是指在模型输出中植入统计信号(水印),以便后续可验证该输出由给定模型生成。强水印方案满足如下性质:计算受限的攻击者无法在不造成显著质量退化的情况下擦除水印。本文研究强水印方案的不可能性。我们证明,在明确且自然的假设下,强水印是无法实现的。这即使在私有检测算法设置下也成立,其中水印植入和检测算法共享一个攻击者未知的密钥。为证明该结果,我们提出了一种通用的高效水印攻击;攻击者无需知道方案的私钥,甚至无需知道使用了哪种方案。我们的攻击基于两个假设:(1)攻击者可以访问“质量预言机”,能够评估候选输出是否是对提示的高质量响应;(2)攻击者可以访问“扰动预言机”,能够以非平凡概率修改输出并保持质量,并且在高质量输出上诱导出高效混合的随机游走。我们认为,这两个假设都可以由计算能力弱于被加水印模型本身的攻击者满足,而攻击者仅能黑盒访问该模型。此外,随着模型能力和模态的增长,我们的假设可能只会随时间更易满足。我们通过实例化该攻击来攻击三种现有的大语言模型水印方案以证明其可行性:Kirchenbauer 等人(2023)、Kuditipudi 等人(2023)和 Zhao 等人(2023)。同一攻击成功移除了所有三种方案植入的水印,且仅造成轻微质量退化。
引用
@article{arxiv.2311.04378,
title = {Watermarks in the Sand: Impossibility of Strong Watermarking for Generative Models},
author = {Hanlin Zhang and Benjamin L. Edelman and Danilo Francati and Daniele Venturi and Giuseppe Ateniese and Boaz Barak},
journal= {arXiv preprint arXiv:2311.04378},
year = {2025}
}
备注
ICML 2024. Website: https://hanlin-zhang.com/impossibility-watermarks