中文

关于堆叠对改善推理的归纳偏置

计算与语言 2024-10-01 v1 人工智能 机器学习

摘要

鉴于模型规模日益增大,诸如渐进式堆叠 [Gong et al., 2019, Reddi et al., 2023] 等新颖的训练策略引起了广泛关注。堆叠通过分阶段逐渐增加模型的深度,并使用前一阶段较小模型的层来初始化下一阶段,从而实现高效训练。尽管堆叠对训练很高效,但这种增长方式引起的模型偏置在很大程度上尚未被探索。在本工作中,我们研究了渐进式堆叠的这一基本方面,超越了其效率优势。我们提出了一种名为 MIDAS 的渐进式堆叠变体,可将语言模型训练加速高达 40%。此外,我们发现了一个有趣的现象:MIDAS 不仅训练高效,而且令人惊讶地具有改善下游任务的归纳偏置,尤其是需要推理能力的任务,如阅读理解和数学问题,尽管其困惑度与基线训练相似或略差。为了进一步分析这种归纳偏置,我们构建了推理原语——作为推理构建模块的简单合成任务——并发现使用堆叠预训练的模型在这些原语上明显优于标准预训练,无论是否进行微调。这为这种面向推理的归纳偏置提供了更强有力的、更稳健的证据。这些关于训练效率和面向推理的归纳偏置的发现已在 1B、2B 和 8B 参数语言模型上得到验证。最后,我们通过探索堆叠与循环模型的联系,推测了这种归纳偏置的潜在原因,并提供了强有力的支持性实证分析。

关键词

引用

@article{arxiv.2409.19044,
  title  = {On the Inductive Bias of Stacking Towards Improving Reasoning},
  author = {Nikunj Saunshi and Stefani Karp and Shankar Krishnan and Sobhan Miryoosefi and Sashank J. Reddi and Sanjiv Kumar},
  journal= {arXiv preprint arXiv:2409.19044},
  year   = {2024}
}

备注

Accepted at NeurIPS 2024