Google SynthID 文本水印的鲁棒性评估与增强
计算机视觉与模式识别
2025-08-29 v1 人工智能
计算与语言
机器学习
摘要
近期 LLM 水印方法如 Google DeepMind 的 SynthID-Text 已提供了用于追踪 AI 生成文本来源的有前景的解决方案。然而,我们的鲁棒性评估揭示了 SynthID-Text 在意义保持攻击(如改写、复制粘贴修改和回译)下易受到攻击,这些攻击可显著降低水印可检测性。为解决这些限制,我们提出了 SynGuard,一种混合框架,结合语义信息检索 (SIR) 的语义对齐强度与 SynthID-Text 的概率水印机制。我们的做法在词汇和语义层面共同嵌入水印,实现在保留原始意义的同时实现稳健的来源跟踪。实验结果表明,在多种攻击情景下,SynGuard 比 SynthID-Text 在 F1 分数上平均提高了 11.1%。这些发现表明了语义感知水印在抵抗实际篡改方面的有效性。所有代码、数据集和评估脚本均公开于 https://github.com/githshine/SynGuard。
引用
@article{arxiv.2508.20227,
title = {A Novel Framework for Automated Explain Vision Model Using Vision-Language Models},
author = {Phu-Vinh Nguyen and Tan-Hanh Pham and Chris Ngo and Truong Son Hy},
journal= {arXiv preprint arXiv:2508.20227},
year = {2025}
}