中文

利用 Transformer 学习情境内 n 元语法:子 n 元语法是近似稳态点

机器学习 2025-08-20 v2

摘要

受持续平台和阶段性训练过程观察的启发,我们研究在情境下一词预测任务上训练的 Transformer 模型损失景观。具体而言,我们聚焦于在交叉熵损失下学习情境内 n 元语法语言模型,建立参数配置为稳态点的充分条件。随后,我们构造了一组简化 Transformer 模型的参数配置,代表用于估计 k 元语法(k ≤ n)的参数。我们证明,在序列长度和参数范数无限时,这些解处的population损失梯度消失。这揭示了损失景观的关键属性:{子 n 元语法是 population 交叉熵损失的近似稳态点},从而为广泛观察到的现象,如阶段性学习动力学和新兴相位转变提供了理论洞见。这些见解通过数值实验进一步得到支持,这些实验说明了 n 元语法学习动力学,由离散的近似稳态解之间的转变所特征化。

关键词

引用

@article{arxiv.2508.12837,
  title  = {Learning In-context n-grams with Transformers: Sub-n-grams Are Near-stationary Points},
  author = {Aditya Varre and Gizem Yüce and Nicolas Flammarion},
  journal= {arXiv preprint arXiv:2508.12837},
  year   = {2025}
}

备注

ICML2025