中文

PMark:面向鲁棒且无失真的语义级水印方法

密码学与安全 2026-03-03 v2 计算与语言

摘要

语义级水印(Semantic-level Watermarking, SWM)通过将句子作为基本单元来增强大语言模型(Large Language Models, LLMs)的水印鲁棒性,能够抵御文本修改和改写攻击。然而,现有方法仍缺乏强大的鲁棒性理论保障,且基于拒绝抽样的生成方式常常引入显著的分布失真,与未加水印的输出结果不符。本文提出了一种新的SWM理论框架,引入代理函数(proxy functions, PFs)——将句子映射到标量值的函数。基于该框架,我们提出了PMark,一种简单且高效的SWM方法,通过动态抽样估计下一个句子的PF中位数,并通过强制执行多个PF约束(即所谓的通道)来增强水印证据。凭借坚实的理论保障,PMark实现了预期的无失真特性,并提升了对改写式攻击的鲁棒性。我们还提供了一个经验优化版本,进一步消除动态中位数估计的需求,以提升抽样效率。实验结果表明,PMark在文本质量和鲁棒性方面均优于现有SWM基线方法,为检测机器生成文本提供了更有效的范式。我们的代码将在[此链接](https://github.com/PMark-repo/PMark)发布。

关键词

引用

@article{arxiv.2509.21057,
  title  = {PMark: Towards Robust and Distortion-free Semantic-level Watermarking with Channel Constraints},
  author = {Jiahao Huo and Shuliang Liu and Bin Wang and Junyan Zhang and Yibo Yan and Aiwei Liu and Xuming Hu and Mingxun Zhou},
  journal= {arXiv preprint arXiv:2509.21057},
  year   = {2026}
}

备注

ICLR 2026 Poster