多句重采样:缓解数据集长度偏置与束搜索退化的简单方法
计算与语言
2021-09-15 v1 人工智能
机器学习
摘要
神经机器翻译(NMT)已知存在束搜索问题:在某一临界点之后,增大束宽会导致翻译质量整体下降。该效应在长句中尤为明显。尽管已有大量工作分析这一现象(主要针对自回归 NMT 模型),其根本原因仍无共识。在本文中,我们分析了在 NMT 与自动语音识别(ASR)中因大束宽导致质量严重退化的错误。我们表明,强烈促成大束宽质量退化的一个因素是\textit{数据集长度偏置}——\textit{NMT 数据集强烈偏向于短句}。为缓解此问题,我们提出一种新的数据增强技术——\textit{多句重采样(MSR)}。该技术通过将原始数据集中的若干句子拼接来扩展训练样本,从而构造长训练样本。我们证明 MSR 显著减少了随束宽增大而产生的退化,并提升了在 IWSTL En-Vi、IWSTL En-Fr 和 WMT En-De 数据集上的最终翻译质量。
引用
@article{arxiv.2109.06253,
title = {Multi-Sentence Resampling: A Simple Approach to Alleviate Dataset Length Bias and Beam-Search Degradation},
author = {Ivan Provilkov and Andrey Malinin},
journal= {arXiv preprint arXiv:2109.06253},
year = {2021}
}