PDR:面向 LLM 预训练数据检测的插即式位置衰减框架
计算与语言
2026-01-13 v1
摘要
检测大语言模型(LLM)中的预训练数据对于审计数据隐私和版权合规性至关重要,但在黑盒、零样图设置下仍具挑战,因为计算资源和训练数据有限。虽然已有的基于似然的方法取得了进展,但它们通常使用均匀权重对 token 级别的得分进行求和,忽略了自回归生成中固有的信噪动力学。本文我们假设并经验验证,记忆信号在高熵初始 token 上尤为显著,此时模型不确定性最高,随着上下文累积而衰减。为利用这一语言特性,我们引入位置衰减重加权(Positional Decay Reweighting, PDR),一个无训练、插即式的框架。PDR 显式地对 token 级别的得分进行重加权,以放大早期位置的独特信号,同时抑制后期的噪声。大量实验表明,PDR 作为鲁棒的先验条件,通常可以提升广泛的先进方法在多个基准上的表现。
引用
@article{arxiv.2601.06827,
title = {PDR: A Plug-and-Play Positional Decay Framework for LLM Pre-training Data Detection},
author = {Jinhan Liu and Yibo Yang and Ruiying Lu and Piotr Piekos and Yimeng Chen and Peng Wang and Dandan Guo},
journal= {arXiv preprint arXiv:2601.06827},
year = {2026}
}