中文

利用合成数据解锁后验数据集推断

机器学习 2025-06-19 v1 人工智能

摘要

大型语言模型 (LLM) 的卓越能力主要归因于其庞大的训练数据集,而这些数据集通常是从互联网上抓取的,未尊重数据所有者的知识产权。数据集推断 (DI) 提供了一种可能的解决方案,通过识别疑似数据集是否用于训练,从而使数据所有者能够验证未经授权的使用。然而,现有的DI方法需要一个私有且已知不在训练中的集合——这与被 compromise 数据集的分布密切匹配。这种分布内、留出数据在实际中很少可用,严重限制了DI的适用性。在本工作中,我们通过合成生成所需的留出集来解决这一挑战。我们的ethods 解决了两个关键障碍:(1) 通过在精心设计的后缀基准 completion 任务上训练的数据生成器来创建高质量、多样化的合成数据,以准确反映原始分布;以及 (2) 通过后验校准来弥合真实数据与合成数据之间的似然差距。广泛的实验表明,使用我们生成的数据作为留出集可使DI以高置信度检测原始训练集,同时保持低的假阳性率。这一结果使版权所有者能够对数据使用情况提出正当的主张,证明了该方法在现实诉讼中的可靠性。我们的代码已公开于 https://github.com/sprintml/PostHocDatasetInference。

关键词

引用

@article{arxiv.2506.15271,
  title  = {Unlocking Post-hoc Dataset Inference with Synthetic Data},
  author = {Bihe Zhao and Pratyush Maini and Franziska Boenisch and Adam Dziedzic},
  journal= {arXiv preprint arXiv:2506.15271},
  year   = {2025}
}

备注

Accepted at ICML 2025