Google SynthID 文本水印的鲁棒性评估与增强
密码学与安全
2025-10-23 v2 计算与语言
摘要
LLM 水印方法(如 Google DeepMind 的 SynthID-Text)的最新进展为追踪 AI 生成文本的来源提供了有前景的解决方案。然而,我们的鲁棒性评估表明,SynthID-Text 容易受到保义攻击(如改写、复制粘贴修改和回译)的影响,这些攻击会显著降低水印的可检测性。为了解决这些局限性,我们提出了 SynGuard,这是一个混合框架,它将语义信息检索 (SIR) 的语义对齐强度与 SynthID-Text 的概率水印机制相结合。我们的方法在词汇和语义两个层面共同嵌入水印,在保持原始含义的同时实现稳健的来源追踪。在多种攻击场景下的实验结果表明,与 SynthID-Text 相比,SynGuard 在 F1 分数上将水印恢复率平均提高了 11.1\%。这些发现证明了语义感知水印在抵抗现实世界篡改方面的有效性。所有代码、数据集和评估脚本均公开于:https://github.com/githshine/SynGuard。
引用
@article{arxiv.2508.20228,
title = {Robustness Assessment and Enhancement of Text Watermarking for Google's SynthID},
author = {Xia Han and Qi Li and Jianbing Ni and Mohammad Zulkernine},
journal= {arXiv preprint arXiv:2508.20228},
year = {2025}
}
备注
Accepted by TrustCom2025