中文

线性双Gram模型在齐夫定律下梯度下降与符号下降的比例定律

机器学习 2025-05-27 v1 最优化与控制

摘要

最近的研究突出了Transformer基语言模型第一层和最后一层训练中梯度下降所面临的优化困难,这些困难通过Adam等优化器得以克服。这些研究表明,困难与文本数据中词语的重尾分布有关,其中第k个最常见词πk\pi_k的频率与1/k1/k成正比,遵循齐夫定律。为更好地理解数据分布对训练性能的影响,我们研究当词元遵循幂律分布πk1/kα\pi_k \propto 1/k^\alpha(以指数α>0\alpha > 0参数化)时,针对下一个词预测的线性双Gram模型。我们推导了确定性梯度下降和作为Adam代理的符号下降的优化比例定律,作为指数α\alpha的函数。现有的比例定律理论 investigation 假设数据特征值为幂律衰减,指数α>1\alpha > 1。这种假设实际上使问题'有限维',因为大部分损失来自少数最大特征分量。在比较方面,我们显示当数据具有更重的尾部时,问题更困难。指数α=1\alpha = 1的情况,如文本数据中所发现的,是梯度下降的'最坏情况',即到达小相对误差所需的迭代次数几乎与维度数呈线性比例增长。虽然符号下降的性能也取决于维度,但对于齐夫分布的数据,迭代次数仅随维度的平方根增长,从而在大型词汇表上实现显著改进。

关键词

引用

@article{arxiv.2505.19227,
  title  = {Scaling Laws for Gradient Descent and Sign Descent for Linear Bigram Models under Zipf's Law},
  author = {Frederik Kunstner and Francis Bach},
  journal= {arXiv preprint arXiv:2505.19227},
  year   = {2025}
}