中文

WRAP++:网络发现增强预训练

计算与语言 2026-04-10 v2 人工智能

摘要

合成数据改写已成为增强大语言模型(LLM)预训练中知识获取的强大技术。然而,现有方法在单文档层面运作,孤立地改写单个网页。这使得合成示例局限于文档内知识,缺失跨文档关系,并使事实缺乏关联性上下文。我们提出 WRAP++(Web discoveRy Amplified Pretraining),通过从网页超链接中发现跨文档关系并为每个发现的文档对合成联合 QA,从而增强事实知识的关联性上下文。具体而言,WRAP++ 发现高置信度的关系模式,包括双链接和共提及,并合成需要跨两个文档进行推理的 QA。这产生了任一源文档单独所不具备的关系性知识,为同一事实创建了多样化的入口点。由于有效实体对的数量呈组合式增长,这种以发现驱动的合成也将数据规模大幅放大至单文档改写之外。在 Wikipedia 上实例化 WRAP++,我们将约 84 亿个 token 的原始文本放大为 800 亿个 token 的跨文档 QA 数据。在 SimpleQA 上,7B 和 32B 两个规模的 OLMo 模型经 WRAP++ 训练后大幅优于单文档方法,并展现出持续的扩展增益,凸显了跨文档知识发现与放大的优势。

关键词

引用

@article{arxiv.2604.06829,
  title  = {WRAP++: Web discoveRy Amplified Pretraining},
  author = {Jiang Zhou and Yunhao Wang and Xing Wu and Tinghao Yu and Feng Zhang},
  journal= {arXiv preprint arXiv:2604.06829},
  year   = {2026}
}

备注

Work in progress. Correspondence to [email protected] or [email protected]