中文

Transformer 中跨层参数共享的经验启示

计算与语言 2023-06-05 v4 机器学习

摘要

我们提出了一种用于 Transformer (Vaswani et al., 2017) 的参数共享方法。所提出的方法放宽了一种广泛使用的技术(该技术将一层的参数与所有层共享,如 Universal Transformers (Dehghani et al., 2019)),以提高计算时间的效率。我们提出了三种策略:Sequence、Cycle 和 Cycle (rev),用于为每一层分配参数。实验结果表明,所提出的策略在参数规模和计算时间上都是高效的。此外,我们指出在使用大量训练数据(如近期的 WMT 竞赛)的配置下,所提出的策略同样有效。

关键词

引用

@article{arxiv.2104.06022,
  title  = {Lessons on Parameter Sharing across Layers in Transformers},
  author = {Sho Takase and Shun Kiyono},
  journal= {arXiv preprint arXiv:2104.06022},
  year   = {2023}
}

备注

SustaiNLP 2023