分析稀疏与含噪数据集下字符级翻译的应用
计算与语言
2021-09-29 v1 人工智能
机器学习
摘要
本文分析了在基于枢轴语的翻译中,当应用于稀疏且含噪的数据集(如众包电影字幕)时所使用的字符级机器翻译模型。在我们的实验中,我们发现此类字符级模型将未翻译词的数量减少了超过40%,并且在训练数据有限的情况下尤其具有竞争力(提升2-3个BLEU点)。我们探讨了字符对齐、短语表过滤、双语文本规模以及枢轴语选择对翻译质量的影响。我们进一步将级联翻译模型与使用多枢轴合成训练数据的方法进行比较,发现后者效果显著更好。最后,我们证明由于BLEU对长度的敏感性,词级与字符级BLEU均无法与人类判断完全相关。
引用
@article{arxiv.2109.13723,
title = {Analyzing the Use of Character-Level Translation with Sparse and Noisy Datasets},
author = {Jörg Tiedemann and Preslav Nakov},
journal= {arXiv preprint arXiv:2109.13723},
year = {2021}
}
备注
machine translation, character-level, pivoting, cascade models, character alignment, phrase table filtering