水印型大语言模型能否通过精心设计的提示被用户识别?
密码学与安全
2025-01-29 v3 计算与语言
摘要
文本水印技术在检测大语言模型(LLM)输出和防止滥用方面取得了显著进展。当前水印技术具备高可检测性、对文本质量影响小以及对文本编辑的鲁健性,但现有研究缺乏对水印技术在LLM服务中不可见性的考察。这关乎因为在实际场景中,LLM提供方可能不愿透露水印的存在,因为这可能降低用户使用服务的意愿,使水印更易受到攻击。本文首次考察水印型大语言模型的不可见性。我们设计了一种名为Water-Probe的识别算法,通过对LLM施以精心设计的提示来检测水印。我们的核心动机是当前水印型LLM在相同水印密钥下会暴露一致的偏差,从而导致不同水印密钥下的提示之间产生相似差异。实验表明,我们精心设计的提示几乎能轻易识别所有主流水印算法,而Water-Probe对非水印型LLM的误报率极低。最后,我们提出,提高水印不可见性的关键在于增加水印密钥选择的随机性。基于此,我们引入了Water-Bag策略,通过合并多个水印密钥显著提升水印的不可见性。
引用
@article{arxiv.2410.03168,
title = {Can Watermarked LLMs be Identified by Users via Crafted Prompts?},
author = {Aiwei Liu and Sheng Guan and Yiming Liu and Leyi Pan and Yifei Zhang and Liancheng Fang and Lijie Wen and Philip S. Yu and Xuming Hu},
journal= {arXiv preprint arXiv:2410.03168},
year = {2025}
}
备注
28 pages, 5 figures, 11 tables Published as a conference paper at ICLR 2025 Github link: https://github.com/THU-BPM/Watermarked_LLM_Identification