TextSeal:用于源文件与蒸馏保护的局部化大语言模型水印
密码学与安全
2026-05-22 v2 计算与语言
机器学习
摘要
我们介绍 TextSeal,一种最先进的大语言模型水印。基于 Gumbel-max 抽样,TextSeal 引入双密钥生成以恢复输出多样性,结合熵加权评分和多区域局部化以提高检测效果。它支持推断优化,如投机解码和多 token 预测,不增加任何推断开销。TextSeal 在检测强度上严格优于诸如 SynthID-text 等基准,并对稀释具有鲁性,即使在混合人类/AI 文档中也能保持自信的局部化检测。该方案在理论上无失真,跨推理基准测试的评估表明其保留下游性能;而 6000 项A/B比较、5 语言的人类评估显示无可感知的质量差异。除了用于源文件检测外,TextSeal 亦具备"放射性"特征:其水印信号可通过模型蒸馏传递,实现未授权使用的检测。
关键词
引用
@article{arxiv.2605.12456,
title = {TextSeal: A Localized LLM Watermark for Provenance & Distillation Protection},
author = {Tom Sander and Hongyan Chang and Tomáš Souček and Tuan Tran and Valeriu Lacatusu and Sylvestre-Alvise Rebuffi and Alexandre Mourachko and Surya Parimi and Christophe Ropers and Rashel Moritz and Vanessa Stark and Hady Elsahar and Pierre Fernandez},
journal= {arXiv preprint arXiv:2605.12456},
year = {2026}
}