多语言自注意力翻译模型的参数共享方法
计算与语言
2018-09-14 v2 机器学习
摘要
在多语言神经机器翻译中,已有研究表明在多种语言间共享单一翻译模型可获得具有竞争力的性能,有时甚至优于双语训练的模型。然而,这些提升并不均匀;由于翻译模型无法在有限的参数空间中容纳不同语言,多语言参数共享常导致准确率下降。在本工作中,我们考察了介于完全共享与独立训练之间的参数共享技术,特别关注自注意力 Transformer 模型。我们发现,完全参数共享方法主要在与目标语言同属相似语系时带来 BLEU 分数的提升。然而,即使在目标语言来自不同语系、完全参数共享导致 BLEU 分数明显下降的情况下,我们提出的参数部分共享方法也能带来翻译准确率的实质性改进。
引用
@article{arxiv.1809.00252,
title = {Parameter Sharing Methods for Multilingual Self-Attentional Translation Models},
author = {Devendra Singh Sachan and Graham Neubig},
journal= {arXiv preprint arXiv:1809.00252},
year = {2018}
}
备注
Third Conference on Machine Translation (WMT 2018)