中文

单层随机权重Transformer中隐藏了什么?

计算与语言 2021-09-10 v1 人工智能

摘要

我们证明,在单层随机权重神经网络中,隐藏着一些子网络,它们无需修改权重初始化,就能在机器翻译任务上取得令人印象深刻的性能。为了找到单层随机权重神经网络的子网络,我们对同一权重矩阵应用不同的二值掩码来生成不同的层。在单层随机权重Transformer中,我们发现子网络在IWSLT14/WMT14上可以达到29.45/17.29的BLEU值。使用固定的预训练嵌入层,先前发现的子网络比训练好的Transformer small/base模型更小,但在IWSLT14/WMT14上分别能达到其98%/92%(34.14/25.24 BLEU)的性能。此外,我们展示了更大更深Transformer在此设置下的有效性,以及不同初始化方法的影响。我们在 https://github.com/sIncerass/one_layer_lottery_ticket 发布了源代码。

关键词

引用

@article{arxiv.2109.03939,
  title  = {What's Hidden in a One-layer Randomly Weighted Transformer?},
  author = {Sheng Shen and Zhewei Yao and Douwe Kiela and Kurt Keutzer and Michael W. Mahoney},
  journal= {arXiv preprint arXiv:2109.03939},
  year   = {2021}
}

备注

EMNLP 2021 (short)