中文

Supernova:在Transformer架构中做更多的事

计算与语言 2025-07-23 v2 人工智能 机器学习

摘要

我们提出Supernova,这是一个6.5亿参数的解码器-only transformer,展示了通过精心的架构设计和分词创新,如何在保持计算效率的同时实现更大模型的性能。我们的架构结合了旋转位置编码(RoPE)、带3:1压缩比的分组查询注意力(GQA)、用于计算效率的RMSNorm以及SwiGLU激活函数。一个关键创新是我们的自定义12.8万词汇量的字节级BPE分词器,实现了最先进的压缩性能。通过详细分析,我们展示Supernova在使用35%更少参数和仅需1000亿训练标记(相当于竞争模型的十分之一)的情况下,达到了10亿参数模型90%的性能。我们的发现挑战了当前的规模范式,表明架构效率和分词质量可以弥补参数数量的减少。

关键词

引用

@article{arxiv.2507.15773,
  title  = {Supernova: Achieving More with Less in Transformer Architectures},
  author = {Andrei-Valentin Tanase and Elena Pelican},
  journal= {arXiv preprint arXiv:2507.15773},
  year   = {2025}
}