中文

探索Transformer在下一词预测中的普适性

机器学习 2025-03-04 v2 机器学习

摘要

因果Transformer被训练以预测给定上下文后的下一个token。虽然广泛接受自注意力机制对于编码序列因果结构至关重要,但这种in-context自回归学习能力背后的精确机制仍不清晰。本文通过研究Transformer对下一词预测的逼近能力,致力于理解这一现象。具体而言,我们探讨了因果Transformer预测下一个token xt+1x_{t+1} 的能力,该能力基于给定的自回归序列 (x1,,xt)(x_1, \dots, x_t) 作为提示,其中 xt+1=f(xt)x_{t+1} = f(x_t),且 ff 是随每个序列而变化的上下文相关函数。在理论层面,我们聚焦于特定情形,即当 ff 为线性函数或 (xt)t1(x_t)_{t \geq 1} 为周期序列时。我们明确构建了一个Transformer(采用线性、指数或softmax注意力)通过因果 kernel descent 方法在in-context中学习映射 ff。我们提出的因果 kernel descent 方法可从仅基于过去和当前观察值 (x1,,xt)(x_1, \dots, x_t) 的情况下可provably估计 xt+1x_{t+1},其与Hilbert空间中的Kaczmarz算法相联系。我们 presented实验结果验证了理论发现,并表明其适用于更一般的映射 ff

关键词

引用

@article{arxiv.2410.03011,
  title  = {Towards Understanding the Universality of Transformers for Next-Token Prediction},
  author = {Michael E. Sander and Gabriel Peyré},
  journal= {arXiv preprint arXiv:2410.03011},
  year   = {2025}
}

备注

ICLR 2025, 20 pages