锚定解码:为任意语言模型提供可证明的版权风险降低方法
计算与语言
2026-05-27 v2
摘要
语言模型 (LMs) 倾向于记忆其训练数据中的 portions 并产生逐字复制。当底层来源涉及保密或受版权保护时,这种复制会引发对创作者的同意与补偿问题以及开发者的合规风险。我们提出锚定解码 (Anchored Decoding),一种用于抑制逐字复制的插拨式推理时方法:它使任何基于混合许可证数据训练的有风险 LM 能够在与 permissively 训练的安全 LM 保持受控接近性的前提下进行解码。锚定解码自适应地在解码轨迹上分配用户选择的信息预算,并强制执行可保证序列级约束,实现可调的风险-效用权衡。为使锚定解码实用,我们引入了新的 permissively 训练的安全模型 (TinyComma 1.8B),以及锚定_字节 解码 (Anchored Decoding),这是一种字节级变体,通过 ByteSampler 框架实现跨词汇表融合。在六个模型对之间,锚定解码与锚定_字节 解码定义了新的 Pareto 前沿,在保持接近原始流畅性与事实性的同时,将有风险基线与安全参考之间的可测量复制鸿沟缩小最高可达 75%,仅增加有限的推理开销。
关键词
引用
@article{arxiv.2602.07120,
title = {Anchored Decoding: Provably Reducing Copyright Risk for Any Language Model},
author = {Jacqueline He and Jonathan Hayase and Wen-tau Yih and Sewoong Oh and Luke Zettlemoyer and Pang Wei Koh},
journal= {arXiv preprint arXiv:2602.07120},
year = {2026}
}
备注
Accepted to ICML 2026. 53 pages, 14 figures, 22 tables. Code is publicly available at https://github.com/jacqueline-he/anchored-decoding