中文

测试时重用预训练数据是一种计算放大器

计算与语言 2025-11-07 v1

摘要

大型语言模型从其庞大的预训练语料库中学习,能够解决越来越多的任务;然而尽管研究人员致力于改进这些数据集,但几乎没有工作致力于理解预训练装置从数据中提取想法和知识的效率。在本文中,我们使用检索增强生成(retrieval augmented generation)以及测试时计算来量化预训练是否遗漏了大量数据价值,以及随规模变化的情况。我们展示,预训练后检索标准且大部分开源的数据集可在MMLU、Math-500和SimpleQA上实现显著的精度提升,这些提升在去除敏感信息后仍然存在。对于MMLU,我们观察到检索相对于仅进行预训练约为5倍的计算放大器。我们表明,通过在测试时利用额外计算来解析检索上下文,可以进一步提高这些结果,在公开的LLaMA 3.1 8B模型上MMLU可提升约10个百分点。总体而言,我们的结果表明,当今的预训练方法未充分利用现有预训练数据集中的信息,仍有大量提升空间。

关键词

引用

@article{arxiv.2511.04234,
  title  = {Reusing Pre-Training Data at Test Time is a Compute Multiplier},
  author = {Alex Fang and Thomas Voice and Ruoming Pang and Ludwig Schmidt and Tom Gunter},
  journal= {arXiv preprint arXiv:2511.04234},
  year   = {2025}
}