为什么小型语言模型表现不佳?通过Softmax瓶颈研究语言模型饱和现象
计算与语言
2024-04-12 v1
摘要
近期语言建模的进展包括在极其庞大的网络文本语料库上预训练高度参数化的神经网络。在实践中,此类模型的训练和推理成本可能很高,这促使人们使用更小的模型。然而,人们观察到,较小的模型可能会遭受饱和现象,其特征是在训练的某个后期阶段性能下降,随后进入平台期。在本文中,我们发现这种饱和现象可以用较小模型的隐藏维度与目标上下文概率分布的高秩之间的不匹配来解释。这种不匹配通过众所周知的softmax瓶颈现象影响了此类模型中使用的线性预测头的性能。我们在各种设置下测量了softmax瓶颈的影响,发现基于少于1000个隐藏维度的模型在预训练后期倾向于采用退化的潜在表示,从而导致评估性能下降。
引用
@article{arxiv.2404.07647,
title = {Why do small language models underperform? Studying Language Model Saturation via the Softmax Bottleneck},
author = {Nathan Godey and Éric de la Clergerie and Benoît Sagot},
journal= {arXiv preprint arXiv:2404.07647},
year = {2024}
}