面向语言模型的公开可检测水印
机器学习
2025-01-07 v4 计算与语言
密码学与安全
摘要
我们提出一种面向 LMs 的公开可检测水印方案:检测算法不含秘密信息,且任何人都可执行。我们利用拒绝采样将公开可验证的密码学签名嵌入 LM 输出,并证明这产生了不可伪造且无失真(即,在无公钥访问情况下不可检测)的文本输出。我们利用纠错来克服低熵时段,这是所有先前水印方案的障碍。我们实现了该方案,并发现我们的形式化声明在实践中的确成立。
引用
@article{arxiv.2310.18491,
title = {Publicly-Detectable Watermarking for Language Models},
author = {Jaiden Fairoze and Sanjam Garg and Somesh Jha and Saeed Mahloujifar and Mohammad Mahmoody and Mingyuan Wang},
journal= {arXiv preprint arXiv:2310.18491},
year = {2025}
}