探索Transformer在下一词预测中的普适性
机器学习
2025-03-04 v2 机器学习
摘要
因果Transformer被训练以预测给定上下文后的下一个token。虽然广泛接受自注意力机制对于编码序列因果结构至关重要,但这种in-context自回归学习能力背后的精确机制仍不清晰。本文通过研究Transformer对下一词预测的逼近能力,致力于理解这一现象。具体而言,我们探讨了因果Transformer预测下一个token 的能力,该能力基于给定的自回归序列 作为提示,其中 ,且 是随每个序列而变化的上下文相关函数。在理论层面,我们聚焦于特定情形,即当 为线性函数或 为周期序列时。我们明确构建了一个Transformer(采用线性、指数或softmax注意力)通过因果 kernel descent 方法在in-context中学习映射 。我们提出的因果 kernel descent 方法可从仅基于过去和当前观察值 的情况下可provably估计 ,其与Hilbert空间中的Kaczmarz算法相联系。我们 presented实验结果验证了理论发现,并表明其适用于更一般的映射 。
引用
@article{arxiv.2410.03011,
title = {Towards Understanding the Universality of Transformers for Next-Token Prediction},
author = {Michael E. Sander and Gabriel Peyré},
journal= {arXiv preprint arXiv:2410.03011},
year = {2025}
}
备注
ICLR 2025, 20 pages