中文

基于解码约束束搜索估计语言模型的近似逐字抽取风险

计算与语言 2026-03-27 v1 机器学习

摘要

最近的研究表明,标准的贪婪解码抽取方法用于量化大语言模型中的记忆,忽略了抽取风险随序列不同而变化的细节。概率抽取——计算在特定解码方案下给定前缀后生成目标后缀的概率——可解决此问题,但仅可针对逐字记忆情况可行,无法捕捉近似逐字实例,这类实例同样构成隐私和版权风险。量化近似逐字抽取风险代价高昂:近似逐字后缀集合庞大,鲁棒的蒙特卡洛(MC)估计可能需要约100,000个样本。为缓解此成本,我们引入解码约束束搜索,能以约20个MC样本/序列的成本,对近似逐字抽取风险提供确定性下界。在实验中,我们的方法揭示了逐字方法难以察觉的信息:可抽取序列数量大幅增加,单序列抽取质量显著提升,以及近似逐字抽取风险在模型规模和文本类型下如何呈现模式。

关键词

引用

@article{arxiv.2603.24917,
  title  = {Estimating near-verbatim extraction risk in language models with decoding-constrained beam search},
  author = {A. Feder Cooper and Mark A. Lemley and Christopher De Sa and Lea Duesterwald and Allison Casasola and Jamie Hayes and Katherine Lee and Daniel E. Ho and Percy Liang},
  journal= {arXiv preprint arXiv:2603.24917},
  year   = {2026}
}