中文

面向多样化机器翻译的混合模型:实践技巧

计算与语言 2019-05-27 v2 机器学习

摘要

通过 EM 训练的混合模型是机器学习文献中最简单、最广泛使用且被充分理解的潜变量模型之一。令人惊讶的是,这些模型在机器翻译等文本生成应用中几乎未被探索。原则上,它们提供潜变量以控制生成并产生多样化假设集合。然而在实践中,混合模型易出现退化——通常只有一个分量得到训练,或潜变量被直接忽略。我们发现,在责任度计算时禁用 dropout 噪声对成功训练至关重要。此外,参数化、先验分布、硬 EM 与软 EM、以及在线与离线分配的设计选择会剧烈影响模型性能。我们开发了一种评估协议,以针对多个参考评估生成的质量与多样性,并对若干混合模型变体进行了广泛的实证研究。我们的分析表明,与变分模型及多样化解码方法相比,某些类型的混合模型更鲁棒,并在翻译质量与多样性间提供了最佳权衡。\footnote{复现本文结果的代码见 \url{https://github.com/pytorch/fairseq}}

关键词

引用

@article{arxiv.1902.07816,
  title  = {Mixture Models for Diverse Machine Translation: Tricks of the Trade},
  author = {Tianxiao Shen and Myle Ott and Michael Auli and Marc'Aurelio Ranzato},
  journal= {arXiv preprint arXiv:1902.07816},
  year   = {2019}
}

备注

ICML 2019 camera-ready