架构如何影响预训练语言模型的基础能力?基于 FFN-Wider 和 MoE Transformer 的案例研究
计算与语言
2024-11-01 v3
摘要
预训练语言模型已被证明具有强大的基础能力,不仅在分布内语言建模方面表现出色,而且在分布外语言建模、迁移学习和少样本学习方面也显示出强大的能力。与现有工作关注规模对基础能力的影响不同,我们的工作考察了架构对这些能力的影响。具体而言,我们关注的问题是:架构如何影响预训练语言模型的基础能力?在这项工作中,我们试图解释并逆转由 FFN-Wider Transformer 架构引起的基础能力下降,以期提供一些见解。通过分析,我们发现多头注意力(一种组合函数)对预训练语言建模的贡献率是影响基础能力的关键因素。FFN-Wider Transformer 降低了该组合函数的贡献率,导致基础能力下降。我们通过实验证实了这一点,并提出了组合增强架构 (CEA) 以解决此类模型基础能力下降的问题。值得注意的是,我们将我们的解释和 CEA 扩展到了专家混合 (MoE) Transformer。我们在一个 14B 参数的 MoE 模型上成功实现了基础能力的显著提升,证明了我们工作的实际应用价值。这也表明,我们的分析对架构分析、架构改进和架构设计具有一定的指导意义。
引用
@article{arxiv.2403.02436,
title = {How does Architecture Influence the Base Capabilities of Pre-trained Language Models? A Case Study Based on FFN-Wider and MoE Transformers},
author = {Xin Lu and Yanyan Zhao and Bing Qin and Liangyu Huo and Qing Yang and Dongliang Xu},
journal= {arXiv preprint arXiv:2403.02436},
year = {2024}
}
备注
Accepted by NeurIPS 2024