中文

面向语言模型的公开可检测水印

机器学习 2025-01-07 v4 计算与语言 密码学与安全

摘要

我们提出一种面向 LMs 的公开可检测水印方案:检测算法不含秘密信息,且任何人都可执行。我们利用拒绝采样将公开可验证的密码学签名嵌入 LM 输出,并证明这产生了不可伪造且无失真(即,在无公钥访问情况下不可检测)的文本输出。我们利用纠错来克服低熵时段,这是所有先前水印方案的障碍。我们实现了该方案,并发现我们的形式化声明在实践中的确成立。

关键词

引用

@article{arxiv.2310.18491,
  title  = {Publicly-Detectable Watermarking for Language Models},
  author = {Jaiden Fairoze and Sanjam Garg and Somesh Jha and Saeed Mahloujifar and Mohammad Mahmoody and Mingyuan Wang},
  journal= {arXiv preprint arXiv:2310.18491},
  year   = {2025}
}