面向语言模型的鲁棒无失真水印
机器学习
2024-06-07 v3 计算与语言
密码学与安全
摘要
我们提出一种在自回归语言模型生成的文本中植入水印的方法,该水印对扰动具有鲁棒性,且在不超过某一最大生成预算的前提下不改变文本上的分布。我们通过将一串随机数(使用随机水印密钥计算)映射到语言模型的样本来生成带水印文本。任何知晓密钥的一方均可将文本与随机数列对齐以检测水印。我们用两种采样方案实例化该水印方法:逆变换采样与指数最小采样。我们将这些水印应用于三个语言模型——OPT-1.3B、LLaMA-7B 和 Alpaca-7B——以实验验证其统计功效及对多种改写攻击的鲁棒性。值得注意的是,对于 OPT-1.3B 和 LLaMA-7B 模型,我们发现即便在通过随机编辑(即替换、插入或删除)破坏 – 的词元后,仍可从 个词元可靠检测水印文本()。对于 Alpaca-7B 模型,我们就对典型用户指令回复加水印的可行性进行了案例研究。由于回复的熵较低,检测更为困难:约 的回复(其中位数长度约 个词元)可被以 检测,且水印对我们实现的某些自动改写攻击也较不鲁棒。
引用
@article{arxiv.2307.15593,
title = {Robust Distortion-free Watermarks for Language Models},
author = {Rohith Kuditipudi and John Thickstun and Tatsunori Hashimoto and Percy Liang},
journal= {arXiv preprint arXiv:2307.15593},
year = {2024}
}
备注
reformatting of camera-ready version accepted to TMLR, with minor edits to introduction