中文

面向大语言模型的可证明训练数据识别

机器学习 2026-02-16 v2 人工智能

摘要

识别大规模模型的训练数据对于版权诉讼、隐私审计以及确保公平评估至关重要。然而,现有工作通常将这一任务视为逐实例的识别,无法控制所识别集合的错误率,因此难以提供统计上可靠的证据。在本工作中,我们将训练数据识别形式化为集合层面的推断问题,并提出可证明训练数据识别(PTDI),一种无需分布假设的方法,能够实现可证明且严格的错误识别率控制。具体而言,我们的方法利用一组已知未见数据为每个数据点计算保形 p 值,然后开发一种新的 Jackknife 校正 Beta 边界(JKBB)估计量来估计测试集的训练数据比例,从而对这些 p 值进行尺度缩放。通过将 Benjamini-Hochberg(BH)过程应用于缩放后的 p 值,我们能够筛选出一个具有可证明且严格错误识别控制的数据点子集。在多种模型与数据集上的大量实验表明,PTDI 在严格控制错误识别率(FIR)的同时,实现了比先前方法更高的统计检验力。

关键词

引用

@article{arxiv.2510.09717,
  title  = {Provable Training Data Identification for Large Language Models},
  author = {Zhenlong Liu and Hao Zeng and Weiran Huang and Hongxin Wei},
  journal= {arXiv preprint arXiv:2510.09717},
  year   = {2026}
}