链式清洗:扩散语言模型水印的多步骤重写攻击
计算与语言
2026-05-08 v1
摘要
统计水印是验证文本是否由语言模型生成的常用方法。大多数现有方案假设自回归生成,即按左到右生成标记,上下文哈希定义明确。扩散语言模型通过对标记进行任意顺序的去噪来生成文本,这些方案无法直接应用。Gloaguen 等人最近提出的水印针对 LLaDA 8B Instruct,报告的真阳性检测率超过 99%。本文研究当水marked文本被重写多次时的情形。使用相同的水印配置,在五个 WaterBench 领域中生成约 300 个标记的 1,605 个水marked 完成项。每个完成项都由四个开源权重语言模型重写,参数规模从 1.5B 到 8B,None 知道水印密钥。测试五种重写风格:改写、人性化、简化、学术和总结扩写。每种风格链式最多五次 hop,总计产生 160,500 份重写文本。标准显著性阈值下,原始输出的水印检测率为 87.9%。单次重写后,检测率在 14% 到 41% 之间,取决于重写模型和风格。五次链式重写后,检测率降至 4.86%,意味着 94.76% 的最初被检测的文本不再被标记。三次重写后,检测得分从水marked 基线向 null 分布的距离下降了 86%。因此,多次重写比单次重写更强大的攻击,结果在所测试的四个重写模型上均成立。
引用
@article{arxiv.2605.05503,
title = {Chainwash: Multi-Step Rewriting Attacks on Diffusion Language Model Watermarks},
author = {Mohd Ruhul Ameen and Akif Islam and Nadim Mahmud and Md. Ekramul Hamid},
journal= {arXiv preprint arXiv:2605.05503},
year = {2026}
}
备注
13 pages, 5 figures, 3 tables