中文

基于类别重参数化技巧的端到端回译训练

计算与语言 2024-07-02 v4 机器学习

摘要

回译(BT)是神经机器翻译(NMT)中一种有效的半监督学习框架。一个预训练的 NMT 模型翻译单语句子并为另一个 NMT 模型的训练生成合成双语句对,反之亦然。将这两个 NMT 模型分别视为推断模型与生成模型,变分自编码器(VAE)的训练方法在先前工作中被采用,而 VAE 是生成模型的主流框架。然而,翻译句子的离散性阻碍了梯度信息在两个 NMT 模型之间流动。本文中,我们提出类别重参数化技巧(CRT),使 NMT 模型生成可微分的句子,从而 VAE 的训练框架能以端到端方式工作。我们在 WMT 基准数据集上进行的 BT 实验证明了我们所提出的 CRT 相对于 Gumbel-softmax 技巧(一种流行的类别变量重参数化方法)的优越性。此外,我们在多个 WMT 基准数据集上的实验表明,就 BLEU 分数而言,我们的端到端训练框架不仅相对于未以端到端方式训练的对应基线更有效,而且相对于其他先前的 BT 工作也更有效。代码已在网上提供。

关键词

引用

@article{arxiv.2202.08465,
  title  = {End-to-End Training for Back-Translation with Categorical Reparameterization Trick},
  author = {DongNyeong Heo and Heeyoul Choi},
  journal= {arXiv preprint arXiv:2202.08465},
  year   = {2024}
}