大语言模型的上下文水印
计算与语言
2026-04-07 v2
摘要
大语言模型(LLM)在敏感应用中的日益广泛使用,凸显了对有效水印技术以确保 AI 生成文本来源与可追溯性的需求。然而,大多数现有水印方法需要访问解码过程,这限制了其在实际场景中的应用。一个典型的例子是学术同行评审中不诚实的评审者使用 LLM 的场景,会议组织者无法访问所使用的模型,但仍需检测 AI 生成的评审意见。出于弥补这一空白的目的,我们提出了上下文水印(In-Context Watermarking, ICW),它仅通过提示工程将水印嵌入生成文本中,利用 LLM 的上下文学习和指令遵循能力。我们研究了四种不同粒度级别的 ICW 策略,每种策略都搭配了针对性的检测方法。我们进一步将间接提示注入(Indirect Prompt Injection, IPI)设置作为具体案例研究,其中水印通过修改学术手稿等输入文档被隐蔽触发。我们的实验验证了 ICW 作为一种模型无关的实用水印方法的可行性。此外,我们的研究结果表明,随着 LLM 能力的不断提升,ICW 为可扩展且易于访问的内容溯源提供了有前景的方向。代码地址:https://github.com/yepengliu/In-Context-Watermarks。
引用
@article{arxiv.2505.16934,
title = {In-Context Watermarks for Large Language Models},
author = {Yepeng Liu and Xuandong Zhao and Christopher Kruegel and Dawn Song and Yuheng Bu},
journal= {arXiv preprint arXiv:2505.16934},
year = {2026}
}
备注
ICLR2026