中文

MAP 解码足矣吗?神经机器翻译中模的不足

计算与语言 2020-10-29 v2

摘要

近期研究揭示了神经机器翻译(NMT)系统的若干病态现象。解释这些现象的大多数假说认为 NMT 作为模型或其训练算法(最大似然估计,MLE)存在根本性问题。此类证据大多通过使用最大后验(MAP)解码收集,该决策规则旨在识别得分最高的翻译,即模。我们认为这些证据更多地证实了 MAP 解码的不足,而非对模型及其训练算法提出质疑。在本工作中,我们表明翻译分布确实能较好地复现数据的各种统计量,但束搜索偏离了此类统计量。我们表明 NMT 某些已知的病态与偏差源于 MAP 解码,而非 NMT 的统计假设或 MLE。特别地,我们表明模型下最可能的翻译所累积的概率质量极少,以至于该模可被视为本质上是任意的。因此我们主张使用整体考虑翻译分布的决策规则。我们表明,对最小贝叶斯风险解码的近似给出了有竞争力的结果,证实了 NMT 模型确实在期望意义上很好地捕捉了翻译的重要方面。

关键词

引用

@article{arxiv.2005.10283,
  title  = {Is MAP Decoding All You Need? The Inadequacy of the Mode in Neural Machine Translation},
  author = {Bryan Eikema and Wilker Aziz},
  journal= {arXiv preprint arXiv:2005.10283},
  year   = {2020}
}

备注

COLING 2020 camera-ready