重新审视水印技术对释义攻击的鲁棒性
密码学与安全
2024-11-11 v1 计算与语言
机器学习
摘要
随着人们对互联网上大量出现语言模型(LM)生成内容的担忧日益加剧,水印技术被视为一种验证文本是否由模型生成的原则性方法。许多近期的水印技术通过微调语言模型的输出概率来嵌入可在后续检测的信号。自文本水印的早期提案以来,其对释义的鲁棒性一直是备受讨论的话题。近期,一些技术被专门设计并声称对释义具有鲁棒性。然而,此类水印方案并未充分考虑它们被逆向工程的容易程度。我们证明,仅通过访问黑盒水印模型的有限数量的生成结果,我们就可以大幅提高释义攻击规避水印检测的有效性,从而使水印失效。
引用
@article{arxiv.2411.05277,
title = {Revisiting the Robustness of Watermarking to Paraphrasing Attacks},
author = {Saksham Rastogi and Danish Pruthi},
journal= {arXiv preprint arXiv:2411.05277},
year = {2024}
}
备注
EMNLP 2024