用于大型语言模型的文体学水印
计算与语言
2024-05-15 v1
摘要
大型语言模型(LLM)的快速发展使得区分人类和机器编写的文本变得越来越困难。为解决这一问题,我们提出了一种生成水印的新方法,该方法在生成过程中策略性地改变 token 概率。与以往工作不同,该方法独特地采用了文体学等语言学特征。具体而言,我们将藏头诗和感觉运动规范引入 LLM。此外,这些特征由一个密钥进行参数化,该密钥每句话更新一次。为了计算该密钥,我们使用语义零样本分类,从而增强了鲁棒性。在我们的评估中,我们发现对于三个或更多句子,我们的方法实现了 0.02 的假阳性和假阴性率。对于循环翻译攻击的情况,我们在七个或更多句子中观察到类似的结果。这项研究对于专有 LLM 尤为重要,有助于促进问责制并防止社会危害。
引用
@article{arxiv.2405.08400,
title = {Stylometric Watermarks for Large Language Models},
author = {Georg Niess and Roman Kern},
journal= {arXiv preprint arXiv:2405.08400},
year = {2024}
}
备注
19 pages, 4 figures, 9 tables