一种用于大语言模型的可公开验证不可伪造水印
计算与语言
2024-05-28 v7
摘要
近来,针对大语言模型(LLMs)的文本水印算法被提出,以缓解LLMs生成文本带来的潜在危害,包括假新闻与版权问题。然而,当前水印检测算法需要水印生成过程中所用的密钥,使其在公开检测时易遭安全泄露与伪造。为克服该局限,我们提出一种名为UPV的不可伪造可公开验证水印算法,其使用两个不同的神经网络分别进行水印生成与检测,而非在两阶段使用同一密钥。同时,生成与检测网络间共享词元嵌入参数,使检测网络能极高效地达到高准确率。实验表明,我们的算法通过神经网络获得了高检测准确率与计算效率。后续分析确认了从检测网络伪造水印所涉及的高复杂度。我们的代码见 \href{https://github.com/THU-BPM/unforgeable_watermark}{https://github.com/THU-BPM/unforgeable\_watermark}。此外,我们的算法也可通过MarkLLM \citep{pan2024markllm} \footnote{https://github.com/THU-BPM/MarkLLM} 访问。
引用
@article{arxiv.2307.16230,
title = {An Unforgeable Publicly Verifiable Watermark for Large Language Models},
author = {Aiwei Liu and Leyi Pan and Xuming Hu and Shu'ang Li and Lijie Wen and Irwin King and Philip S. Yu},
journal= {arXiv preprint arXiv:2307.16230},
year = {2024}
}
备注
ICLR2024, 17 pages, 5 figures, 8 tables