中文

从模型权重近似语言模型训练数据

计算与语言 2025-06-19 v1

摘要

现代语言模型通常具有开放的权重但封闭的训练数据。我们形式化了从模型权重逼近数据的问题,并提出了若干基线方法和指标。我们发展了一种基于梯度的方法,从大型公共文本语料库中选择与之匹配度最高的数据,并展示了其在仅知晓原始模型和微调后模型权重时恢复有用数据的有效性。即使在完全不知晓真实训练数据的情形下,我们的方法也能定位到一小部分公共网页文档,用于训练接近原始模型性能的模型。在 AG News 分类任务上,我们的方法将性能从 65% 提升到 80%,逼近专家基准的 88%。当应用在使用 SFT 在 MSMARCO 网页文档上训练的模型时,我们的方法将困惑度从 3.3 降低到 2.3,而专家 LLAMA 模型的困惑度为 2.0。

关键词

引用

@article{arxiv.2506.15553,
  title  = {Approximating Language Model Training Data from Weights},
  author = {John X. Morris and Junjie Oscar Yin and Woojeong Kim and Vitaly Shmatikov and Alexander M. Rush},
  journal= {arXiv preprint arXiv:2506.15553},
  year   = {2025}
}