中文

论文重审:变换器语言模型的形状惯例

计算与语言 2026-02-09 v1 人工智能 机器学习

摘要

稠密变换器语言模型主要遵循一种一致的架构形状:每层包含注意力模块,后接一个前馈网络(FFN),采用窄-宽-窄的多层感知机(MLP),在2到4之间的扩展比之间,将大多数参数分配给MLP。针对最近的结果表明残差宽-窄-宽(倒金字塔)MLP在更优的函数逼近能力方面具有优势,我们重新审视变换器中长期存在的MLP形状惯例,挑战窄-宽-窄设计的必要性。为此,我们发展了一个变换器变体,将常规FFN替换为由多个倒金字塔子MLP组成的更深的倒金字塔FFN,通过残差通路相连。我们认为,虽然更深但更轻的倒金字塔FFN可以作为常规FFN的有竞争力的替代方案,并且,使用更轻的倒金字塔FFN所节省的资源可以更有效地利用,例如在固定预算下扩大模型隐藏维度。我们通过不同模型规模的实证验证确认了这些发现:倒金字塔FFN在达到4亿参数时优于常规FFN,在更大规模(10亿参数)上表现相当;带有较少FFN参数和更多注意力参数的倒金字塔FFN变体在相同预算下的常规配置方面表现出一致的改进。总体而言,这些发现为最近的工作提供了新的视角,促使我们重新思考窄-宽-窄MLP惯例以及注意力与FFN之间的平衡,以实现高效且有表现力的现代语言模型。

关键词

引用

@article{arxiv.2602.06471,
  title  = {Revisiting the Shape Convention of Transformer Language Models},
  author = {Feng-Ting Liao and Meng-Hsi Chen and Guan-Ting Yi and Da-shan Shiu},
  journal= {arXiv preprint arXiv:2602.06471},
  year   = {2026}
}