中文

一种用于大语言模型的可公开验证不可伪造水印

计算与语言 2024-05-28 v7

摘要

近来,针对大语言模型(LLMs)的文本水印算法被提出,以缓解LLMs生成文本带来的潜在危害,包括假新闻与版权问题。然而,当前水印检测算法需要水印生成过程中所用的密钥,使其在公开检测时易遭安全泄露与伪造。为克服该局限,我们提出一种名为UPV的不可伪造可公开验证水印算法,其使用两个不同的神经网络分别进行水印生成与检测,而非在两阶段使用同一密钥。同时,生成与检测网络间共享词元嵌入参数,使检测网络能极高效地达到高准确率。实验表明,我们的算法通过神经网络获得了高检测准确率与计算效率。后续分析确认了从检测网络伪造水印所涉及的高复杂度。我们的代码见 \href{https://github.com/THU-BPM/unforgeable_watermark}{https://github.com/THU-BPM/unforgeable\_watermark}。此外,我们的算法也可通过MarkLLM \citep{pan2024markllm} \footnote{https://github.com/THU-BPM/MarkLLM} 访问。

关键词

引用

@article{arxiv.2307.16230,
  title  = {An Unforgeable Publicly Verifiable Watermark for Large Language Models},
  author = {Aiwei Liu and Leyi Pan and Xuming Hu and Shu'ang Li and Lijie Wen and Irwin King and Philip S. Yu},
  journal= {arXiv preprint arXiv:2307.16230},
  year   = {2024}
}

备注

ICLR2024, 17 pages, 5 figures, 8 tables