中文

基于句法可预测性的人类语言模型水印

计算与语言 2026-04-20 v4 人工智能

摘要

随着大型语言模型 (LLM) 的快速发展,可靠的治理工具变得至关重要。公开可验证的水印对于培育值得信赖的人工智能生态系统尤为关键。一个核心挑战是:在文本质量与检测鲁棒性之间取得平衡。近期研究试图通过利用模型输出分布的信号(例如,标记级熵)来导航这一权衡;然而,这些方法依赖于这些模型特定的信号,对于公开验证检测构成了重大障碍,因为检测过程需要访问底层模型的 logits。我们引入 STELA,这是一个新型框架,将水印强度与语言中固有的句法自由度相吻合。STELA 动态调制信号,使用基于词性 (POS) n 元语法建模的语言不确定性,在语法受约束的上下文中削弱信号以保持质量,在具有更大语言灵活性的上下文中增强信号以提升检测灵敏度。我们的检测器无需访问任何模型 logits,从而促进了公开可验证的检测。通过在具有代表性的语言类型中进行大量实验——分析性英语、孤立中文以及屈折化韩语——我们展示 STELA 在检测鲁棒性方面超越了先前方法。我们的代码已公开:https://github.com/Shinwoo-Park/stela_watermark

关键词

引用

@article{arxiv.2510.13829,
  title  = {A Linguistics-Aware LLM Watermarking via Syntactic Predictability},
  author = {Shinwoo Park and Hyejin Park and Hyeseon An and Yo-Sub Han},
  journal= {arXiv preprint arXiv:2510.13829},
  year   = {2026}
}

备注

ACL 2026