轻量版Transformer
计算与语言
2020-02-17 v1 机器学习
摘要
Transformer因其以高效方式捕获序列信息的能力而被广泛使用。然而,近期的发展,如BERT和GPT-2,仅提供了侧重于有效性的重型架构。在本文中,我们探索了三种精心设计的轻量Transformer架构,以探明计算量更少的Transformer能否产生有竞争力的结果。在语言模型基准数据集上的实验结果表明,这种权衡是有前景的,轻量Transformer最多减少70%的参数,同时取得了与标准Transformer相当的困惑度。源代码已公开可用。
引用
@article{arxiv.2002.06170,
title = {Transformer on a Diet},
author = {Chenguang Wang and Zihao Ye and Aston Zhang and Zheng Zhang and Alexander J. Smola},
journal= {arXiv preprint arXiv:2002.06170},
year = {2020}
}
备注
6 pages, 2 tables, 1 figure