Transformer 中跨层参数共享的经验启示
计算与语言
2023-06-05 v4 机器学习
摘要
我们提出了一种用于 Transformer (Vaswani et al., 2017) 的参数共享方法。所提出的方法放宽了一种广泛使用的技术(该技术将一层的参数与所有层共享,如 Universal Transformers (Dehghani et al., 2019)),以提高计算时间的效率。我们提出了三种策略:Sequence、Cycle 和 Cycle (rev),用于为每一层分配参数。实验结果表明,所提出的策略在参数规模和计算时间上都是高效的。此外,我们指出在使用大量训练数据(如近期的 WMT 竞赛)的配置下,所提出的策略同样有效。
引用
@article{arxiv.2104.06022,
title = {Lessons on Parameter Sharing across Layers in Transformers},
author = {Sho Takase and Shun Kiyono},
journal= {arXiv preprint arXiv:2104.06022},
year = {2023}
}
备注
SustaiNLP 2023