规模化学习事实:主动阅读
计算与语言
2025-08-14 v1 人工智能
摘要
大语言模型(LLMs)被认为在参数存储中储存了大量知识。然而,学习和回溯这些事实已知不可可靠,取决于训练数据中特定事实的存在程度以及其他较不被理解的因素。实践者缺乏工具来确保模型可靠且一致地学习给定的知识库。为此,我们提出了主动阅读(Active Reading)框架:模型通过自生成的学习策略学习给定材料。首先,我们展示了在专家领域上使用主动阅读训练的模型比纯粹微调和其他数据增强方法吸收了更多知识。我们训练了8B参数的专家模型,通过对每个基准的来源文档应用主动阅读,在维基百科 grounding 的 SimpleQA 子集上达到66%的得分(相对于纯粹微调提升313%),在 FinanceBench 上达到26%的得分(相对于纯粹微调提升160%)。最后,我们表明主动阅读可用于预训练规模构建更可靠的事实模型。作为演示,我们发布了 Meta WikiExpert-8B,这是一个在1万亿生成标记上训练的维基百科专家模型,在事实问答任务中超过了数千亿参数的模型。
引用
@article{arxiv.2508.09494,
title = {Learning Facts at Scale with Active Reading},
author = {Jessy Lin and Vincent-Pierre Berges and Xilun Chen and Wen-Tau Yih and Gargi Ghosh and Barlas Oğuz},
journal= {arXiv preprint arXiv:2508.09494},
year = {2025}
}