论自回归训练Transformer中的元优化:涌现与能力
机器学习
2024-10-29 v2 计算与语言
机器学习
摘要
自回归训练的Transformer为世界带来了深刻的变革,尤其是其处理下游任务的上下文学习能力。最近,一些研究表明Transformer在自回归预训练期间学习了一个元优化器来实现上下文学习。即,训练好的Transformer的前向传播等价于在上下文中优化一个内部目标函数。然而,实际的非凸训练动力学是否会收敛到理想的元优化器仍不清楚。为填补这一空白,我们研究了由梯度流自回归训练的单层线性因果自注意力模型的非凸动力学,其中序列由自回归过程生成。首先,在数据分布的特定条件下,我们证明自回归训练的Transformer通过执行一步梯度下降来在上下文中最小化一个普通最小二乘问题,从而学习。然后,它应用学习到的进行下一个词元预测,从而验证了元优化假设。接下来,在相同的数据条件下,我们探讨了所得元优化器的能力限制。我们证明,与数据矩相关的更强假设是学习到的元优化器恢复分布的充分必要条件。此外,我们在第一个数据条件之外进行了探索性分析,并证明一般情况下,训练后的Transformer不会对普通最小二乘问题执行标准梯度下降。最后,我们的仿真结果验证了理论结果。
引用
@article{arxiv.2405.16845,
title = {On Mesa-Optimization in Autoregressively Trained Transformers: Emergence and Capability},
author = {Chenyu Zheng and Wei Huang and Rongzhen Wang and Guoqiang Wu and Jun Zhu and Chongxuan Li},
journal= {arXiv preprint arXiv:2405.16845},
year = {2024}
}
备注
Accepted by NeurIPS2024, 45 pages. The final version of the previous preprint