大语言模型的检索能力随预训练 FLOPs 而扩展
机器学习
2025-08-26 v1 人工智能
信息检索
摘要
检索性能随预训练 FLOPs 而扩展?我们对 1.25 亿到 70 亿参数的 LLM 进行检索性能基准测试,所使用的预训练数据集规模从 10 亿个 token 到超过 2 万亿个 token 不等。我们发现,LLM 在零样本 BEIR 任务上的检索性能会随 LLM 规模、训练时长和估计 FLOPs 进行可预测的扩展。我们还展示了在-上下文学习分数与检索分数之间存在强烈相关性。最后,我们突出了这对开发基于 LLM 的检索器具有的意义。
引用
@article{arxiv.2508.17400,
title = {Retrieval Capabilities of Large Language Models Scale with Pretraining FLOPs},
author = {Jacob Portes and Connor Jennings and Erica Ji Yuen and Sasha Doubov and Michael Carbin},
journal= {arXiv preprint arXiv:2508.17400},
year = {2025}
}
备注
15 pages, 4 figures