中文

序列建模架构如何影响预训练语言模型的基础能力?探索关键架构设计原则以避免基础能力退化

计算与语言 2025-10-27 v2

摘要

以 Transformer 为代表的预训练语言模型已被证明具备强大的基础能力,而 Transformer 中代表性的自注意力机制已成为序列建模架构的经典。在提出序列建模架构以提高注意力机制效率的工作基础上,本 work 关注序列建模架构对基础能力的影响。具体而言,我们的关注点是:序列建模架构到底如何影响预训练语言模型的基础能力?本 work 首先指出,现有架构设计工作常采用的混合域预训练设置未能充分揭示不同架构在基础能力上的差异。为此,我们提出一种有限域预训练设置并进行分布外测试,成功揭示了在早期阶段不同架构之间在基础能力上的显著差异。随后,我们分析了基于状态的序列建模架构的基础能力,发现其在基础能力上存在显著退化。随后,通过一系列架构组件分析,我们总结出一个关键架构设计原则:序列建模架构必须具备完整序列的任意选择能力,以避免基础能力退化。最后,我们使用一种极其简单的 Top-1 元素选择架构来实证验证该原则,并将其推广到更实用的 Top-1 块选择架构。实验结果表明,我们提出的序列建模架构设计原则,并表明本 work 可为未来的架构改进和新设计提供有价值的参考。

关键词

引用

@article{arxiv.2505.18522,
  title  = {How Does Sequence Modeling Architecture Influence Base Capabilities of Pre-trained Language Models? Exploring Key Architecture Design Principles to Avoid Base Capabilities Degradation},
  author = {Xin Lu and Yanyan Zhao and Si Wei and Shijin Wang and Bing Qin and Ting Liu},
  journal= {arXiv preprint arXiv:2505.18522},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025