GTrans:用于神经机器翻译的 Transformer 层分组与融合
计算与语言
2022-11-14 v2 机器学习
摘要
Transformer 结构由一系列编码器与解码器网络层堆叠而成,在神经机器翻译中取得显著进展。然而,原始 Transformer 主要利用顶层表示,假定底层提供琐碎或冗余信息,从而忽略潜在有价值的底层特征。本文提出分组 Transformer 模型(GTrans),其灵活地将编码器与解码器的多层表示划分为不同组,进而融合这些组特征以生成目标词。为验证所提方法的有效性,我们在三个双语翻译基准与两个多语翻译任务上进行了大量实验与分析实验,包括 IWLST-14、IWLST-17、LDC、WMT-14 与 OPUS-100 基准。实验与分析结果表明,我们的模型以一致增益优于其 Transformer 对应模型。此外,它可成功扩展至 60 个编码器层与 36 个解码器层。
引用
@article{arxiv.2207.14467,
title = {GTrans: Grouping and Fusing Transformer Layers for Neural Machine Translation},
author = {Jian Yang and Yuwei Yin and Liqun Yang and Shuming Ma and Haoyang Huang and Dongdong Zhang and Furu Wei and Zhoujun Li},
journal= {arXiv preprint arXiv:2207.14467},
year = {2022}
}
备注
Accepted in IEEE TASLP