线性双Gram模型在齐夫定律下梯度下降与符号下降的比例定律
机器学习
2025-05-27 v1 最优化与控制
摘要
最近的研究突出了Transformer基语言模型第一层和最后一层训练中梯度下降所面临的优化困难,这些困难通过Adam等优化器得以克服。这些研究表明,困难与文本数据中词语的重尾分布有关,其中第k个最常见词的频率与成正比,遵循齐夫定律。为更好地理解数据分布对训练性能的影响,我们研究当词元遵循幂律分布(以指数参数化)时,针对下一个词预测的线性双Gram模型。我们推导了确定性梯度下降和作为Adam代理的符号下降的优化比例定律,作为指数的函数。现有的比例定律理论 investigation 假设数据特征值为幂律衰减,指数。这种假设实际上使问题'有限维',因为大部分损失来自少数最大特征分量。在比较方面,我们显示当数据具有更重的尾部时,问题更困难。指数的情况,如文本数据中所发现的,是梯度下降的'最坏情况',即到达小相对误差所需的迭代次数几乎与维度数呈线性比例增长。虽然符号下降的性能也取决于维度,但对于齐夫分布的数据,迭代次数仅随维度的平方根增长,从而在大型词汇表上实现显著改进。
引用
@article{arxiv.2505.19227,
title = {Scaling Laws for Gradient Descent and Sign Descent for Linear Bigram Models under Zipf's Law},
author = {Frederik Kunstner and Francis Bach},
journal= {arXiv preprint arXiv:2505.19227},
year = {2025}
}