中文

面向多语言翻译的自适应稀疏Transformer

计算与语言 2022-01-25 v2

摘要

多语言机器翻译近来备受关注,因为与大量双语模型相比,它支持语言间的知识迁移且训练与部署成本低。多语言模型的一个已知挑战是负语言干扰。为提升翻译质量,更深更宽的结构被应用于多语言建模以扩大模型容量,但同时也面临推理成本增加的问题。近期研究指出,语言间共享的参数是干扰的成因,而它们也可能促成正向迁移。基于这些见解,我们提出了一种用于多语言建模的自适应稀疏架构,并训练模型学习共享与语言特定参数,以增强正向迁移并缓解干扰。该稀疏架构仅激活保留推理效率的子网络,且自适应设计根据输入语言选择不同子网络。我们的模型在多个基准上优于强基线。在包含100100种语言的大规模OPUS数据集上,相较于标准Transformer,我们在一对多、多对一和零样本任务上分别取得了+2.1+2.1+1.3+1.3+6.2+6.2的BLEU提升,且不增加推理成本。

关键词

引用

@article{arxiv.2104.07358,
  title  = {Adaptive Sparse Transformer for Multilingual Translation},
  author = {Hongyu Gong and Xian Li and Dmitriy Genzel},
  journal= {arXiv preprint arXiv:2104.07358},
  year   = {2022}
}