面向随时有效性的统计水印技术
机器学习
2026-02-20 v1 人工智能
机器学习
摘要
大型语言模型(LLM)的快速扩散 necessitates 高效的机制来区分机器生成内容与人类文本。尽管统计水印方法已成为有前景的解决方案,但现有方法存在两个关键局限:缺乏用于选择抽样分布的原则方法,以及依赖固定时段假设检验,阻碍了有效的早期停止。在本文中,我们通过构建首个基于 e-value 的水印框架——锚定 E 水印(Anchored E-Watermarking),弥合了这一鸿沟,实现了最优抽样与随时有效推断的统一。不同于传统方法,其中可选停止会使 Type-I 错误保证失效,本框架通过构造检测过程的超鞅(supermartingale)实现有效的随时推断。利用锚分布近似目标模型,我们相对于最坕对数增长率 characterize 了最优 e-value,并推导了最优预期停止时间。通过仿真和在 established benchmarks 上的评估,我们的理论论断得到验证,结果表明该框架可显著提升样本效率,使检测所需的平均 token 预算相较于最新基线降低 13-15%。
引用
@article{arxiv.2602.17608,
title = {Towards Anytime-Valid Statistical Watermarking},
author = {Baihe Huang and Eric Xu and Kannan Ramchandran and Jiantao Jiao and Michael I. Jordan},
journal= {arXiv preprint arXiv:2602.17608},
year = {2026}
}