基于字符级 Transformer 的神经机器翻译
计算与语言
2020-05-25 v1
摘要
神经机器翻译(NMT)如今通常在子词级别上应用,采用字节对编码。一种有前景的替代方法侧重于字符级翻译,这大大简化了 NMT 中的处理流程。然而,这种方法必须处理相对更长的序列,导致训练过程成本过高。本文讨论了一种新颖的、基于 Transformer 的方法,我们在速度和翻译质量上将其与子词级和字符级的 Transformer 以及先前开发的字符级模型进行了比较。我们在 WMT'15 的 4 个语言对上评估了我们的模型:德语-英语、捷克语-英语、芬兰语-英语和俄语-英语。所提出的新型架构可在单个 GPU 上训练,且比字符级 Transformer 快 34%;尽管如此,所获得的结果至少与其相当。此外,我们提出的模型在芬兰语-英语上优于子词级模型,在捷克语-英语上结果接近。为了促进该领域的进一步研究并缩小与子词级 NMT 的差距,我们公开了所有代码和模型。
引用
@article{arxiv.2005.11239,
title = {Character-level Transformer-based Neural Machine Translation},
author = {Nikolay Banar and Walter Daelemans and Mike Kestemont},
journal= {arXiv preprint arXiv:2005.11239},
year = {2020}
}