通过主动重构检测语言模型训练数据
机器学习
2026-02-24 v1 人工智能
计算与语言
摘要
检测LLM训练数据通常被形式化为成员推断攻击(MIA)问题。然而,常规MIA是对固定模型权重的被动操作,使用对数似然或文本生成。在本工作中,我们引入了主动数据重构攻击(ADRA),这是一族能够通过训练主动诱导模型重构给定文本的MIA。我们假设训练数据比非成员更易被重构,并且其重构性的差异可用于成员推断。受强化学习(RL)锐化权重中已编码行为启发,我们利用基于策略的RL主动诱导数据重构,通过对目标模型进行微调来实现。为有效地使用RL进行MIA,我们设计了重构指标和对比奖励。 resulting算法为\textsc{ADRA}及其自适应变体\textsc{ADRA+},在给定候选数据池的情况下提高了重构和检测能力。实验表明,我们的方法在检测预训练、后训练和蒸馏数据时 consistently优于现有MIA,平均超过上一名者10.7%。特别是,\MethodPlus 在BookMIA上对预训练检测提升了18.8%,在AIME上对后训练检测提升了7.6%。
引用
@article{arxiv.2602.19020,
title = {Learning to Detect Language Model Training Data via Active Reconstruction},
author = {Junjie Oscar Yin and John X. Morris and Vitaly Shmatikov and Sewon Min and Hannaneh Hajishirzi},
journal= {arXiv preprint arXiv:2602.19020},
year = {2026}
}