面向多语言翻译的自适应稀疏Transformer
计算与语言
2022-01-25 v2
摘要
多语言机器翻译近来备受关注,因为与大量双语模型相比,它支持语言间的知识迁移且训练与部署成本低。多语言模型的一个已知挑战是负语言干扰。为提升翻译质量,更深更宽的结构被应用于多语言建模以扩大模型容量,但同时也面临推理成本增加的问题。近期研究指出,语言间共享的参数是干扰的成因,而它们也可能促成正向迁移。基于这些见解,我们提出了一种用于多语言建模的自适应稀疏架构,并训练模型学习共享与语言特定参数,以增强正向迁移并缓解干扰。该稀疏架构仅激活保留推理效率的子网络,且自适应设计根据输入语言选择不同子网络。我们的模型在多个基准上优于强基线。在包含种语言的大规模OPUS数据集上,相较于标准Transformer,我们在一对多、多对一和零样本任务上分别取得了、和的BLEU提升,且不增加推理成本。
引用
@article{arxiv.2104.07358,
title = {Adaptive Sparse Transformer for Multilingual Translation},
author = {Hongyu Gong and Xian Li and Dmitriy Genzel},
journal= {arXiv preprint arXiv:2104.07358},
year = {2022}
}