中文

Transformer 可扩展性危机:现代语言模型性能壁垒的全面实证分析

机器学习 2026-05-18 v1

摘要

尽管 transformer 架构在自然语言处理方面取得了显著成功,但其可扩展性限制通过系统实证分析仍不清晰。本文提出了对 118 个 transformer 模型进行全面大规模评估的工作,这些模型跨越七个不同的架构类别,揭示了表现出现 hard 部署约束的根本性可扩展性危机。我们的系统化基准测试方法发现,88.1% 的模型成功处理最多 512 个标记,然而在 1024 个标记时这一比例骤降至 44.9%,在 2048 个标记时完全失败(0%)。通过对加载时间、内存消耗和计算效率进行严格分析,覆盖从 128 到 2048 个标记的序列长度,我们证明压缩模型在参数效率上优于大型生成模型(649.2 tokens/sec/M 参数 vs 12.5 tokens/sec/M 参数)。我们的发现挑战了 prevailing scaling 假设,提供了 transformer 注意力复杂度 O(n2)O(n^2) 转化为可测量性能壁垒的第一批定量证据。该工作建立了新的 transformer 评估基准方法,为生产环境中的实际部署决策提供了关键见解。

关键词

引用

@article{arxiv.2605.15413,
  title  = {Transformer Scalability Crisis: The First Comprehensive Empirical Analysis of Performance Walls in Modern Language Models},
  author = {Mahdi Naser Moghadasi and Faezeh Ghaderi},
  journal= {arXiv preprint arXiv:2605.15413},
  year   = {2026}
}

备注

8 pages, accepted at IEEE BigData 2025