面向基于 Transformer 的神经机器翻译的置信度学习
计算与语言
2022-03-23 v1 人工智能
摘要
置信度估计旨在量化模型预测的置信程度,提供对成功可能性的预期。在真实场景中面对含噪样本与分布外数据时,一个经过良好校准的置信度估计能够实现准确的失败预测与恰当的风险度量。然而,该任务对神经机器翻译(NMT)而言仍是一项严峻挑战,因为来自 softmax 分布的概率无法刻画模型可能出错的情形。为解决此问题,我们提出一种无监督置信度估计学习方法,并与 NMT 模型的训练联合进行。我们将置信度解释为 NMT 模型做出正确预测所需的提示数量,所需提示越多表明置信度越低。具体而言,NMT 模型可选择请求提示以提升翻译准确率,代价是承受些许轻微惩罚。随后,我们通过统计模型使用的提示数量来近似其置信度水平。我们证明,我们所学习的置信度估计在广泛的句子级/词级质量估计任务上取得了高准确率。分析结果表明,我们的置信度估计能够正确评估两种真实场景下的潜在风险:(1)发现含噪样本;(2)检测域外数据。我们进一步基于所学习的置信度估计提出了一种新颖的基于置信度的实例特定标签平滑方法,其性能优于标准标签平滑。
引用
@article{arxiv.2203.11413,
title = {Learning Confidence for Transformer-based Neural Machine Translation},
author = {Yu Lu and Jiali Zeng and Jiajun Zhang and Shuangzhi Wu and Mu Li},
journal= {arXiv preprint arXiv:2203.11413},
year = {2022}
}