中文

论神经机器翻译中的长尾现象

计算与语言 2020-10-13 v1 人工智能 机器学习

摘要

最先进的神经机器翻译(NMT)模型在生成低频词元方面存在困难,解决该问题仍是一项重大挑战。在结构化预测任务背景下,推理过程中搜索所带来的额外复杂性进一步阻碍了对长尾现象的分析。在本工作中,我们在两个抽象层次上定量刻画此类长尾现象,即词元分类与序列生成。我们提出了一种新的损失函数,即反焦点损失(Anti-Focal loss),通过在训练过程中融入束搜索的归纳偏置,使模型训练更好地适应条件文本生成的结构依赖。我们在多个机器翻译(MT)数据集上展示了所提技术的有效性,表明其相对于交叉熵在不同语言对上均带来显著增益,尤其在低频词生成方面。我们已发布代码以复现我们的结果。

关键词

引用

@article{arxiv.2010.04924,
  title  = {On Long-Tailed Phenomena in Neural Machine Translation},
  author = {Vikas Raunak and Siddharth Dalmia and Vivek Gupta and Florian Metze},
  journal= {arXiv preprint arXiv:2010.04924},
  year   = {2020}
}

备注

Accepted to Findings of EMNLP 2020