挖掘神经机器翻译中的错误:基于部分假设空间的模型错误评估与理解
计算与语言
2022-10-11 v2 人工智能
摘要
对神经机器翻译(NMT)的可靠评估是其理解与改进的关键。当前对 NMT 系统的评估通常建立在启发式解码算法(如束搜索)以及评估译文与黄金参考之间相似度的度量指标之上。然而,这种系统级评估框架受限于仅评估一个最优假设以及启发式解码算法带来的搜索错误。为了更好地理解 NMT 模型,我们提出了一种新颖的评估协议,其利用模型在假设空间上的排序能力来定义模型错误。为处理指数级大的空间问题,我们提出了两种近似方法:沿精确 top- 解码算法的顶部区域评估(该算法在整个假设空间中寻找排名靠前的假设),以及蒙特卡洛采样评估(从更广阔的视角模拟假设空间)。为了量化错误,我们通过度量由模型排序的假设数组与理想排序的假设数组之间的距离来定义我们的 NMT 模型错误。在确认与人类判断的强相关性后,我们将我们的评估应用于多种 NMT 基准与模型架构。我们表明,最先进的 Transformer 模型面临严重的排序问题,并且在顶部区域仅表现为随机机会水平。我们进一步分析了不同深度与宽度的架构以及不同数据增强技术下的模型错误,展示了这些因素如何影响模型错误。最后,我们将模型错误与搜索算法相联系,并提供了关于束搜索归纳偏置以及与最小贝叶斯风险(MBR)解码相关性的有趣发现。
引用
@article{arxiv.2106.15217,
title = {Digging Errors in NMT: Evaluating and Understanding Model Errors from Partial Hypothesis Space},
author = {Jianhao Yan and Chenming Wu and Fandong Meng and Jie Zhou},
journal= {arXiv preprint arXiv:2106.15217},
year = {2022}
}
备注
To be appeared as a main conference paper at EMNLP 2022