中文

轻量版Transformer

计算与语言 2020-02-17 v1 机器学习

摘要

Transformer因其以高效方式捕获序列信息的能力而被广泛使用。然而,近期的发展,如BERT和GPT-2,仅提供了侧重于有效性的重型架构。在本文中,我们探索了三种精心设计的轻量Transformer架构,以探明计算量更少的Transformer能否产生有竞争力的结果。在语言模型基准数据集上的实验结果表明,这种权衡是有前景的,轻量Transformer最多减少70%的参数,同时取得了与标准Transformer相当的困惑度。源代码已公开可用。

关键词

引用

@article{arxiv.2002.06170,
  title  = {Transformer on a Diet},
  author = {Chenguang Wang and Zihao Ye and Aston Zhang and Zheng Zhang and Alexander J. Smola},
  journal= {arXiv preprint arXiv:2002.06170},
  year   = {2020}
}

备注

6 pages, 2 tables, 1 figure