Transformer 可扩展性危机:现代语言模型性能壁垒的全面实证分析
机器学习
2026-05-18 v1
摘要
尽管 transformer 架构在自然语言处理方面取得了显著成功,但其可扩展性限制通过系统实证分析仍不清晰。本文提出了对 118 个 transformer 模型进行全面大规模评估的工作,这些模型跨越七个不同的架构类别,揭示了表现出现 hard 部署约束的根本性可扩展性危机。我们的系统化基准测试方法发现,88.1% 的模型成功处理最多 512 个标记,然而在 1024 个标记时这一比例骤降至 44.9%,在 2048 个标记时完全失败(0%)。通过对加载时间、内存消耗和计算效率进行严格分析,覆盖从 128 到 2048 个标记的序列长度,我们证明压缩模型在参数效率上优于大型生成模型(649.2 tokens/sec/M 参数 vs 12.5 tokens/sec/M 参数)。我们的发现挑战了 prevailing scaling 假设,提供了 transformer 注意力复杂度 转化为可测量性能壁垒的第一批定量证据。该工作建立了新的 transformer 评估基准方法,为生产环境中的实际部署决策提供了关键见解。
关键词
引用
@article{arxiv.2605.15413,
title = {Transformer Scalability Crisis: The First Comprehensive Empirical Analysis of Performance Walls in Modern Language Models},
author = {Mahdi Naser Moghadasi and Faezeh Ghaderi},
journal= {arXiv preprint arXiv:2605.15413},
year = {2026}
}
备注
8 pages, accepted at IEEE BigData 2025