中文

基于组合水印检测 LLM 生成后编辑的后处理修改

机器学习 2025-10-03 v1

摘要

水印技术已成为专有语言模型区分 AI 生成与人类撰写文本的关键方法。然而,在许多实际场景中,LLM 生成的内容可能经历后处理编辑,如人工修改或欺骗攻击,检测并定位此类修改至关重要。本文提出一种新任务:检测作用于水印 LLM 输出的后生成编辑。为此,我们提出一种基于组合模式的水印框架,将词汇表划分为互斥子集,并通过在生成过程中对这些子集施加确定性组合模式来嵌入水印。我们伴随组合水印引入全局统计量,用于检测水印。此外,我们设计轻量级局部统计量以标记并定位潜在编辑。我们引入两种任务特定评估指标:第 I 类错误率和检测准确率,对方法在开源 LLM 上进行评估,覆盖多种编辑情境,实证表明在编辑定位方面表现优异。

关键词

引用

@article{arxiv.2510.01637,
  title  = {Detecting Post-generation Edits to Watermarked LLM Outputs via Combinatorial Watermarking},
  author = {Liyan Xie and Muhammad Siddeek and Mohamed Seif and Andrea J. Goldsmith and Mengdi Wang},
  journal= {arXiv preprint arXiv:2510.01637},
  year   = {2025}
}