基于任务级混合专家模型的直接神经机器翻译
计算与语言
2024-05-21 v2
摘要
直接神经机器翻译(direct NMT)是一类在非英语两语间翻译文本的 NMT 系统。直接 NMT 系统常因非英语语言对间平行数据稀缺而受限。已有若干方法应对此限制,如多语 NMT 与枢轴 NMT(经英语的两语间翻译)。任务级混合专家模型(Task-level MoE)作为基于 Transformer 模型的推理高效变体,已在大量语言对上展现出有前景的 NMT 性能。在 Task-level MoE 中,不同语言组可使用不同路由策略以优化跨语言学习与推理速度。本工作中,我们考察 Task-level MoE 在直接 NMT 中的适用性,并提出一系列高性能训练与评测配置,据此基于 Task-level MoE 的直接 NMT 系统在大量低资源与高资源直接语言对及翻译方向上优于双语与基于枢轴的模型。我们含 16 个专家的 Task-level MoE 在 7 个语言对上优于双语 NMT、枢轴 NMT 模型,而基于枢轴的模型在 9 个语言对与方向上仍表现更优。
引用
@article{arxiv.2310.12236,
title = {Direct Neural Machine Translation with Task-level Mixture of Experts models},
author = {Isidora Chara Tourni and Subhajit Naskar},
journal= {arXiv preprint arXiv:2310.12236},
year = {2024}
}