中文

大语言模型的检索能力随预训练 FLOPs 而扩展

机器学习 2025-08-26 v1 人工智能 信息检索

摘要

检索性能随预训练 FLOPs 而扩展?我们对 1.25 亿到 70 亿参数的 LLM 进行检索性能基准测试,所使用的预训练数据集规模从 10 亿个 token 到超过 2 万亿个 token 不等。我们发现,LLM 在零样本 BEIR 任务上的检索性能会随 LLM 规模、训练时长和估计 FLOPs 进行可预测的扩展。我们还展示了在-上下文学习分数与检索分数之间存在强烈相关性。最后,我们突出了这对开发基于 LLM 的检索器具有的意义。

关键词

引用

@article{arxiv.2508.17400,
  title  = {Retrieval Capabilities of Large Language Models Scale with Pretraining FLOPs},
  author = {Jacob Portes and Connor Jennings and Erica Ji Yuen and Sasha Doubov and Michael Carbin},
  journal= {arXiv preprint arXiv:2508.17400},
  year   = {2025}
}

备注

15 pages, 4 figures