中文

统计中的事实:预训练多样性对语言模型泛化的影响

计算与语言 2025-10-21 v1 机器学习

摘要

语言模型在预训练过程中会对序列进行处理,将其融合的序列统计规律(使文本流畅)与特定标记之间的事实关联(事实知识)相结合。虽然近期的研究表明,这些关联相互作用的可变性(例如事实关联的同义改写)在决定泛化能力方面起关键作用,但我们仍缺乏对这些影响的系统性分析。本文引入了一种灵活的合成测试基准,该基准将通用标记的统计流与源-目标标记对的抽象事实流相结合,从而实现对其相互作用的细粒度控制。该设计通过操控流的组成(上下文结构)来独立控制多样性的性质,通过调整每个事实出现的统计流的数量来控制多样性水平。在受控实验中,我们发现,尽管更高的上下文多样性会延迟类内(in-distribution, ID)事实准确率,但其对类外(out-of-distribution, OOD)事实泛化的影响取决于上下文结构。在某些情况下,OOD 性能遵循与 ID 相同的趋势,但在其他情况下,多样性对于非平凡的事实记忆至关重要。即使在低多样性阻止事实记忆的情况下,最佳多样性水平也取决于训练持续时间。除了事实记忆失败,我们还识别出统计泛化独立失效的结构,以及两者都退化的其他结构。这表明,上下文设计与多样性水平之间的相互作用如何影响不同的泛化方面。进一步,通过对模型组件的一系列受控干预,我们将 OOD 失败归因于不同的优化瓶颈,突显了嵌入层和解嵌入层的重要性。我们的合成框架允许我们隔离在大规模研究中会被混淆的效应,为未来的研究提供了受控测试基准。

关键词

引用

@article{arxiv.2510.16096,
  title  = {Facts in Stats: Impacts of Pretraining Diversity on Language Model Generalization},
  author = {Tina Behnia and Puneesh Deora and Christos Thrampoulidis},
  journal= {arXiv preprint arXiv:2510.16096},
  year   = {2025}
}

备注

28 pages, 15 figures