中文

记忆还是检索:面向 RAG 感知预训练的缩放定律

计算与语言 2026-04-02 v1 人工智能 机器学习

摘要

检索增强生成(RAG)通过在测试时提供相关上下文来提升语言模型(LM)在知识密集型场景下的性能。然而,参数化知识在预训练中获取与通过检索访问的非参数化知识之间的关系仍了解甚少,尤其是在固定数据预算下。我们系统研究了预训练语料库规模与检索存储规模之间的权衡,覆盖广泛的模型和数据规模。我们训练了基于 OLMo-2 的语言模型,参数规模从 30M 到 3B,在多达 100B 令牌的 DCLM 数据上训练,同时变化预训练数据规模(参数数量的 1-150 倍)和检索语料库规模(1-20 倍),并在涵盖推理、科学问答和开放域问答的多样化基准测试套件上评估性能。我们发现检索始终优于仅参数化基线,并引入了一个三维缩放框架,将性能建模为模型规模、预训练令牌数和检索语料库规模的函数。该缩放流形使我们能够估计固定数据预算在预训练和检索之间的最优分配,揭示检索的边际效用强烈依赖于模型规模、任务类型和预训练饱和度。我们的结果为理解检索何时以及如何补充预训练提供了定量基础,为可扩展语言建模系统的数据资源分配提供了实用指导。

关键词

引用

@article{arxiv.2604.00715,
  title  = {To Memorize or to Retrieve: Scaling Laws for RAG-Considerate Pretraining},
  author = {Karan Singh and Michael Yu and Varun Gangal and Zhuofu Tao and Sachin Kumar and Emmy Liu and Steven Y. Feng},
  journal= {arXiv preprint arXiv:2604.00715},
  year   = {2026}
}

备注

Code and data at https://github.com/DegenAI-Labs/RAG-scaling-laws