跨语言摘要:作为黑盒水印移除攻击
计算与语言
2025-10-30 v1 密码学与安全
摘要
水印化是一种轻量级机制,用于识别 AI 生成文本,通常依赖于对标记分布进行扰动。虽然已有工作表明改写可以削弱此类信号,但此类攻击仍可被部分检测,或会降低文本质量。我们展示了跨语言摘要攻击(cross-lingual summarization attack, CLSA)——即将文本翻译到枢纽语言,然后进行摘要生成,以及可选的回译——构成一种质上更强的攻击向量。通过在语言之间强制实现语义瓶颈,CLSA 系统性地破坏标记级统计偏差,同时保持语义忠实。我们在多个水印方案(KGW、SIR、XSIR、Unigram)和五种语言(Amharic、Chinese、Hindi、Spanish、Swahili)上的实验中表明,CLSA 在相似质量水平下比单语改写更有效地降低水印检测准确率。我们的结果凸显了挑战水印用于源代码或监管的实际漏洞。我们认为,健全的源代码解决方案必须超越基于分布的水印化,纳入加密或模型证书方法。在每个语言上各 300 个保留样本上,CLSA 持续将检测推向随机水平,同时保持任务实用性。具体而言,对于 XSIR(专为跨语言鲁棒性而设计),使用单语改写的 AUROC 为 ,使用中文作为枢纽的 CWRA [He 等,2024] 为 ,而 CLSA 将其降至 (接近随机)。结果凸显了一种实用、低成本的跨语言压缩内容且无可见痕迹的移除路径。
引用
@article{arxiv.2510.24789,
title = {Cross-Lingual Summarization as a Black-Box Watermark Removal Attack},
author = {Gokul Ganesan},
journal= {arXiv preprint arXiv:2510.24789},
year = {2025}
}