利用近似目标端的特征衰减算法进行数据选择
计算与语言
2018-11-08 v1
摘要
应用于神经机器翻译(NMT)的数据选择技术旨在通过检索句子子集作为训练数据来提升模型性能。可能的数据选择技术之一是转导学习方法,其基于测试集(即待翻译文档)选择数据。此类方法迄今的一个局限在于,仅使用源端测试集本身并不能保证所选句子具有正确翻译,或具有适合测试集领域的翻译。某些语料库(如字幕语料库)可能包含因本地化或长度限制而导致翻译不准确的平行句。为尝试解决该问题,本文提出在选择适合训练模型的句对时,除源端外还使用近似目标端。该近似目标端通过对源端进行预翻译构建。本工作中,我们针对一种称为特征衰减算法(FDA)的特定数据选择方法探究这一总体思路的性能。我们使用测试集(源端)、近似目标端及二者混合所选择的数据训练德英NMT模型。我们的发现表明,使用FDA输出组合(利用测试集与近似目标端)构建的模型优于仅使用测试集的模型。相较于使用全部数据训练的模型,我们获得了超过1.5 BLEU点的统计显著改进,且较仅使用源端信息的强FDA基线高出超过0.5 BLEU点。
引用
@article{arxiv.1811.03039,
title = {Data Selection with Feature Decay Algorithms Using an Approximated Target Side},
author = {Alberto Poncelas and Gideon Maillette de Buy Wenniger and Andy Way},
journal= {arXiv preprint arXiv:1811.03039},
year = {2018}
}