中文

先果酱还是先奶油?用 SCONES 建模神经机器翻译中的歧义

计算与语言 2022-05-03 v1

摘要

神经机器翻译中的 softmax 层旨在建模互斥词符上的分布。然而,机器翻译本质上是不可确定的:同一源句可有多个语义等价的译文。因此,我们提议用可更有效建模歧义的多标签分类层替换 softmax 激活函数。我们将此损失函数称为非互斥序列的单标签对比目标(Single-label Contrastive Objective for Non-Exclusive Sequences, SCONES)。我们表明,多标签输出层仍可使用 SCONES 损失函数在单参考训练数据上训练。SCONES 在六个翻译方向上带来一致的 BLEU 分数提升,尤其对中等资源语言对和小束宽表现突出。通过使用更小的束宽,我们可将推理加速 3.9 倍,同时仍匹配或超越 softmax 所得的 BLEU 分数。此外,我们证明 SCONES 可用于训练将最高概率赋予恰当译文的 NMT 模型,从而缓解“束搜索诅咒”。在具有不同不确定性的合成语言对上的额外实验表明,SCONES 带来的改进可归因于对歧义的更好处理。

关键词

引用

@article{arxiv.2205.00704,
  title  = {Jam or Cream First? Modeling Ambiguity in Neural Machine Translation with SCONES},
  author = {Felix Stahlberg and Shankar Kumar},
  journal= {arXiv preprint arXiv:2205.00704},
  year   = {2022}
}

备注

NAACL 2022 paper