中文

理解 Transformer 中的参数共享

机器学习 2023-06-19 v1 人工智能

摘要

参数共享已被证明是一种参数高效的方法。先前关于 Transformer 的工作集中于在不同层之间共享参数,这可通过增加模型深度来提升参数受限模型的性能。本文从两个角度研究该方法为何有效。首先,增加模型深度使模型更为复杂,我们假设其原因与模型复杂度(指 FLOPs)有关。其次,由于每个共享参数在前向传播中会多次参与网络计算,其对应梯度的取值范围将不同于原始模型,这会影响模型收敛。基于此,我们假设训练收敛可能也是原因之一。通过进一步分析,我们表明该方法的成功很大程度上归因于更好的收敛性,仅有小部分源于增加的模型复杂度。受此启发,我们有针对性地调整了与模型收敛相关的训练超参数。在 8 个机器翻译任务上的实验表明,我们的模型仅以参数共享模型一半的模型复杂度取得了具有竞争力的性能。

关键词

引用

@article{arxiv.2306.09380,
  title  = {Understanding Parameter Sharing in Transformers},
  author = {Ye Lin and Mingxuan Wang and Zhexi Zhang and Xiaohui Wang and Tong Xiao and Jingbo Zhu},
  journal= {arXiv preprint arXiv:2306.09380},
  year   = {2023}
}