中文

修改与生成文本检测:通过水印实现 LLM 输出的双重检测能力

密码学与安全 2025-03-04 v2 人工智能

摘要

大语言模型(LLM)的发展引发了潜在滥用方面的顾虑。一种实用解决方案是嵌入水印,通过水印提取来实现所有权验证。现有方法主要关注抵御修改攻击,往往忽视其他欺骗性攻击。例如,攻击者可以修改水印文本以产生有害内容,而不损害水印的存在,从而可能将此恶意内容错误地归因于 LLM。这构成了对 LLM 服务提供商的严重威胁,凸显了同时实现修改检测与生成文本检测的重要性。因此,我们提出一种用于检测文本修改的技术,针对对修改不敏感的水印进行设计,使其对修改敏感。我们引入一种新度量指标,即“被丢弃的标记”(discarded tokens),用于衡量未被包含在水印检测中的标记数量。当发生修改时,该度量指标会发生变化,可作为检测修改的证据。此外,我们改进了水印检测过程,提出一种新的无偏水印方法。我们的实验表明,通过水印可以有效实现修改检测与生成文本检测的双重检测能力。

关键词

引用

@article{arxiv.2502.08332,
  title  = {Modification and Generated-Text Detection: Achieving Dual Detection Capabilities for the Outputs of LLM by Watermark},
  author = {Yuhang Cai and Yaofei Wang and Donghui Hu and Chen Gu},
  journal= {arXiv preprint arXiv:2502.08332},
  year   = {2025}
}