中文

用于神经机器翻译的深度可分离卷积

计算与语言 2017-06-19 v2 机器学习

摘要

深度可分离卷积减少了卷积操作中使用的参数和计算量,同时提高了表示效率。它们已被证明在图像分类模型中是成功的,既能在给定参数量下获得比以往更好的模型(Xception 架构),又能大幅减少在给定性能水平下所需的参数量(MobileNets 架构家族)。最近,卷积序列到序列网络已被应用于机器翻译任务并取得了良好的结果。在这项工作中,我们研究了如何将深度可分离卷积应用于神经机器翻译。我们引入了一种受 Xception 和 ByteNet 启发的新架构,称为 SliceNet,它能够显著减少获得类似 ByteNet 结果所需的参数量和计算量,并且在相似参数量下,取得了新的 SOTA 结果。除了证明深度可分离卷积在机器翻译中表现良好外,我们还研究了它们所带来的架构变化:我们观察到,得益于深度可分离性,我们可以增加卷积窗口的长度,从而消除了对滤波器膨胀的需求。我们还引入了一种新的“超可分离”卷积操作,进一步减少了获得 SOTA 结果所需的参数数量和计算成本。

关键词

引用

@article{arxiv.1706.03059,
  title  = {Depthwise Separable Convolutions for Neural Machine Translation},
  author = {Lukasz Kaiser and Aidan N. Gomez and Francois Chollet},
  journal= {arXiv preprint arXiv:1706.03059},
  year   = {2017}
}