基于分阶段训练的无标签多领域机器翻译
计算与语言
2023-05-09 v1
摘要
大多数多领域机器翻译模型依赖于领域标注数据。遗憾的是,在训练过程和实际翻译场景中通常都无法获得领域标签。在本工作中,我们提出了一种无标签多领域机器翻译模型,该模型在训练中仅需少量或无需领域标注数据,且在推理时不需要领域标签。我们的模型由三部分组成:骨干模型、负责区分来自不同领域数据的领域判别器,以及一组将解码特征从通用迁移到特定的专家。我们设计了一种分阶段训练策略,并依次训练这三部分。为利用额外领域知识并提升训练稳定性,在判别器训练阶段,通过聚类显式建模领域差异,并通过多分类任务将其蒸馏到判别器中。同时,在专家训练阶段采用 Gumbel-Max 采样作为路由方案,以实现各专家在专业化与泛化之间的平衡。德语到英语翻译任务上的实验结果表明,我们的模型在六个不同领域上显著提升了 BLEU 分数,甚至优于大多数使用领域标注数据训练的模型。
引用
@article{arxiv.2305.03949,
title = {Label-Free Multi-Domain Machine Translation with Stage-wise Training},
author = {Fan Zhang and Mei Tu and Sangha Kim and Song Liu and Jinyao Yan},
journal= {arXiv preprint arXiv:2305.03949},
year = {2023}
}