标签平滑在束搜索解码上的隐式长度偏置
计算与语言
2022-05-03 v1
摘要
标签平滑在神经机器翻译(NMT)训练中被普遍使用。尽管标签平滑在模型训练时带来了所需的正则化效果,本文中我们证明它 nonetheless 在束搜索解码过程中引入了长度偏置。我们的分析表明,标签平滑对输出序列隐式地施加了一个长度惩罚项,导致偏向更短翻译的偏置。我们还表明,对于一个经标签平滑充分优化的模型,翻译长度被隐式地由上界为一个独立于输入的固定常数。我们通过推理时应用一个简单的修正函数,从标签平滑的模型预测中恢复无偏分布,从而验证了我们的理论。该修正方法在 WMT 英德、英法、英捷以及英中任务上带来了持续的质量提升,在束大小 4 时最高 +0.3 BLEU,束大小 200 时最高 +2.8 BLEU。
引用
@article{arxiv.2205.00659,
title = {The Implicit Length Bias of Label Smoothing on Beam Search Decoding},
author = {Bowen Liang and Pidong Wang and Yuan Cao},
journal= {arXiv preprint arXiv:2205.00659},
year = {2022}
}