面向开源语言模型的可证明鲁棒水印
密码学与安全
2024-10-25 v1 人工智能
计算与语言
摘要
近期高质量语言模型的激增使得新的识别 AI 生成文本的方法变得必不可少。水印是领先的解决方案,可能在生成 AI 时代成为必备工具。现有方法在推理时嵌入水印,关键依赖于大型语言模型(LLM)的规格和参数保密,这使其不适用于开源环境。在本工作中,我们引入首个针对开源 LLM 的水印方案。该方案通过修改模型参数来实现,但仅凭模型输出即可检测水印。令人惊讶的是的是,我们证明了在 certain 假设下,这些水印是不可被移除的。为展示具体参数实例下的行为,我们针对 OPT-6.7B 和 OPT-1.3B 进行了实验结果。我们展示了对标记替换和模型参数扰动的鲁棒性。我们发现,这些攻击中更强的模型扰动攻击需要将质量分数降至 0/100 才能将检测率降至 50%。
引用
@article{arxiv.2410.18861,
title = {Provably Robust Watermarks for Open-Source Language Models},
author = {Miranda Christ and Sam Gunn and Tal Malkin and Mariana Raykova},
journal= {arXiv preprint arXiv:2410.18861},
year = {2024}
}