中文

使用线性Transformer学习和迁移稀疏上下文二元模型

机器学习 2024-11-01 v1 计算与语言

摘要

Transformer在自然语言建模中表现出色,其成功的原因之一是其结合上下文信息和全局知识的卓越能力。然而,其理论基础仍不清楚。在本文中,我们首先引入了稀疏上下文二元模型(SCB),这是经典二元模型的自然扩展,其中下一个词的生成取决于由最后一个词确定的一组稀疏的先前位置。然后,我们分析了使用基于梯度的算法训练单层线性Transformer来学习SCB的训练动力学和样本复杂度。我们证明,当从头开始训练时,训练过程可以分为一个初始的样本密集阶段,在此阶段相关性从零提升到一个非平凡的值,随后是一个样本效率更高的进一步改进阶段。此外,我们证明,只要下游任务和预训练任务之间存在非平凡的相关性,基于预训练模型进行微调可以让我们绕过初始的样本密集阶段。我们还通过实验证明,我们的算法在此设置下可以优于SGD,并讨论了其与通常基于softmax的Transformer的关系。

关键词

引用

@article{arxiv.2410.23438,
  title  = {Learning and Transferring Sparse Contextual Bigrams with Linear Transformers},
  author = {Yunwei Ren and Zixuan Wang and Jason D. Lee},
  journal= {arXiv preprint arXiv:2410.23438},
  year   = {2024}
}