SLAM:结构语言激活标记用于语言模型
计算与语言
2026-05-12 v2 人工智能
摘要
LLM 水印必须在不损害文本质量的前提下被检测,但大多数现有方案会偏向下一个 token 的分布,以牺牲可检测性为代价。我们提出了 SLAM (Structural Linguistic Activation Marking),一种新型白盒水印方案,通过将标记写入结构几何而非 token 频率来规避这一成本:稀疏自编码器识别编码语言结构(如语态、时态、从句顺序)的残差流方向,并在生成时对这些方向进行因果引导,保持词汇抽样和语义不受约束。在 Gemma-2 2B 和 9B 上,SLAM 实现了 100% 的检测准确率,质量代价仅为 1-2 个 reward 分数——相较于 KGW、EWD 和 Unigram 的 7.5-11.5,自然度和多样性在两款模型下均接近未加水印水平。其权衡是互补的鲁棒性轮廓:SLAM 抗词级编辑,但对重构语法的改写(需付出质量代价)较为脆弱,这正是 token 分布方法的对立面。
引用
@article{arxiv.2605.05443,
title = {SLAM: Structural Linguistic Activation Marking for Language Models},
author = {Fabrice Harel-Canada and Amit Sahai},
journal= {arXiv preprint arXiv:2605.05443},
year = {2026}
}
备注
Under review