在 Transformer 神经机器翻译中推广源语语法知识并非必要
计算与语言
2019-10-25 v1
摘要
语言标注在神经机器翻译中的效用似乎已在过往论文中确立。然而,这些实验局限于循环序列到序列架构以及相对较小的数据设置。我们聚焦于最先进的 Transformer 模型并使用规模相对更大的语料库。具体而言,我们尝试通过简单的操纵数据技术或通过一个专用的模型组件,利用多任务学习来推广源侧的句法知识。特别地,我们训练 Transformer 的一个注意力头以生成源侧依存树。总体而言,我们的结果对带有语言信息的多任务设置的效用提出了一些质疑。先前工作推荐的数据操纵技术在大数据设置中被证明无效。将自注意力视为依存关系的处理似乎更有前景:它有助于翻译并揭示 Transformer 模型可以非常容易地掌握句法结构。然而,一个重要但奇特的结果是,使用平凡的“线性树”而非真实依存关系获得了相同的增益。因此,增益的原因可能并非来自所增加的语言知识,而是来自我们在自注意力矩阵上诱导的某种更简单的正则化效应。
引用
@article{arxiv.1910.11218,
title = {Promoting the Knowledge of Source Syntax in Transformer NMT Is Not Needed},
author = {Thuong-Hai Pham and Dominik Macháček and Ondřej Bojar},
journal= {arXiv preprint arXiv:1910.11218},
year = {2019}
}
备注
CICLING 2019