中文

线性成本推断 Transformer 的跨架构迁移学习

计算与语言 2024-04-04 v1 人工智能 机器学习

摘要

最近提出了多种架构来通过改变自注意力块的设计来提高 Transformer 语言模型的推理效率。其中一个显著方法是 State-Space Machines(SSMs)架构,该架构在语言建模任务上表现与自注意力 Transformer 相当。然而,这种架构变化需要从头开始对权重进行完整预训练,这会给希望使用新架构的研究人员和实践者带来巨大的成本。对于更传统的线性注意力方法,提出了用线性注意力近似完整注意力的 swap-and-finetune 框架。受此方法的启发,我们提出了跨架构迁移学习(XATL),其中将共享组件(如 layernorms、MLPs、输入/输出嵌入)的权重直接从已预训练的模型参数迁移到新架构。我们在不同规模和替代注意力架构上实验了该方法的有效性,表明该方法在相同计算预算下将训练时间缩短最高可达 2.5 倍,并在 LM 基准测试中收敛到更好的最小值,性能提升最高可达 2.6%。

关键词

引用

@article{arxiv.2404.02684,
  title  = {Cross-Architecture Transfer Learning for Linear-Cost Inference Transformers},
  author = {Sehyun Choi},
  journal= {arXiv preprint arXiv:2404.02684},
  year   = {2024}
}

备注

Preprint