大型语言模型中的水印窃取
机器学习
2024-06-25 v2 人工智能
密码学与安全
摘要
大型语言模型 (LLM) 水印作为一种检测 AI 生成内容的有前景的方法受到了关注,一些工作表明当前的方案可能已适合部署。在这项工作中,我们反驳了这一主张,指出水印窃取 (WS) 是这些方案的一个根本性漏洞。我们表明,查询带水印 LLM 的 API 以近似逆向工程水印,不仅能实现先前工作假设的实际欺骗攻击,还能极大地增强此前未被注意到的清除攻击。我们是第一个提出自动化 WS 算法并将其用于现实环境中欺骗和清除的综合研究的团队。我们表明,攻击者只需不到 50 美元即可欺骗和清除先前被认为安全的最新方案,平均成功率超过 80%。我们的发现挑战了关于 LLM 水印的普遍信念,强调了对更稳健方案的需求。我们将所有代码和额外示例公布在 https://watermark-stealing.org。
引用
@article{arxiv.2402.19361,
title = {Watermark Stealing in Large Language Models},
author = {Nikola Jovanović and Robin Staab and Martin Vechev},
journal= {arXiv preprint arXiv:2402.19361},
year = {2024}
}
备注
ICML 2024