中文

面向更小更快解码器 Transformer:架构变体及其影响

机器学习 2024-10-10 v4

摘要

近年来,大型语言模型(LLM)的研究呈指数级增长,主要聚焦于基于 [1] 建立的 Transformer 架构,以及 [2] 进一步发展的解码器-only 变体。当前在该领域的努力主要旨在通过扩大架构和训练期间所利用的数据量来增强模型能力。然而,探索在保持其效能的同时减小模型规模仍寥寥无几。本研究中,我们引入了对解码器-only Transformer 架构的三个修改,分别称为 ParallelGPT(pgpt)、LinearGPT(lgpt)和 ConvGPT(cgpt)。这些变体在语言生成方面表现出与传统架构相当的性能,却具有更小的模型规模和更快的训练进程。我们开源了这些实现的模型权重和完整代码,以供进一步研究使用。

关键词

引用

@article{arxiv.2404.14462,
  title  = {Towards smaller, faster decoder-only transformers: Architectural variants and their implications},
  author = {Sathya Krishnan Suresh and Shunmugapriya P},
  journal= {arXiv preprint arXiv:2404.14462},
  year   = {2024}
}

备注

10 pages, 6 figures