中文

通过参数高效架构将预训练语言模型扩展至更深

计算与语言 2023-04-12 v2

摘要

本文提出一种高度参数高效的方法,将预训练语言模型(PLM)扩展至更深的模型深度。与先前共享全部参数或使用额外块的工作不同,我们基于矩阵乘积算子(MPO)设计了一种能力更强的参数共享架构。MPO 分解可将参数矩阵的信息重组并分解为两部分:包含主要信息的主要部分(中心张量)以及仅含很小比例参数的补充部分(辅助张量)。基于此种分解,我们的架构在所有层间共享中心张量以缩减模型规模,同时保留层特定的辅助张量(亦使用适配器)以增强适配灵活性。为改进模型训练,我们进一步提出了一种针对基于 MPO 架构定制的稳定初始化算法。大量实验证明了我们所提模型在缩减模型规模与取得极具竞争力性能方面的有效性。

关键词

引用

@article{arxiv.2303.16753,
  title  = {Scaling Pre-trained Language Models to Deeper via Parameter-efficient Architecture},
  author = {Peiyu Liu and Ze-Feng Gao and Yushuo Chen and Wayne Xin Zhao and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2303.16753},
  year   = {2023}
}

备注

14 pages, 4 figures, 6 tables