中文

小型语言模型的收敛性挑战

计算与语言 2024-10-16 v1

摘要

增加语言模型的参数数量是提升其性能常用策略,但小型语言模型因运行成本较低仍具价值。尽管如此,小型模型常常在给定相同数据和计算资源的情况下表现不如大型模型,尤其在预训练后期阶段表现下降。这种现象据称归因于其表示能力较弱。然而,具体导致性能下降的原因尚不明确。我们使用Pythia模型系列分析这种现象背后的训练动力学。我们在不同模型规模下 investigates注意力和MLP激活值收敛至最终状态的方式,以及其参数有效秩对此过程的影响。我们发现,在大型模型中, nearly all layers在训练前20%内便已稳定,而小型模型中的层收敛较慢且不够稳定,尤其当其参数有效秩较低时。通过将层激活值的收敛性与参数有效秩关联,我们的分析可指导未来工作改善小型模型学习动力学的效率。

关键词

引用

@article{arxiv.2410.11451,
  title  = {Tending Towards Stability: Convergence Challenges in Small Language Models},
  author = {Richard Diehl Martinez and Pietro Lesci and Paula Buttery},
  journal= {arXiv preprint arXiv:2410.11451},
  year   = {2024}
}