流畅性缺失正在损害你的翻译模型
计算与语言
2022-05-25 v1
摘要
许多机器翻译模型在双语语料库上训练,该语料库由来自两种不同语言、语义相同的对齐句对组成。然而,双语语料库中训练集与测试集之间存在质性差异。大多数训练句子是通过爬取和句子对齐方法等自动技术生成的,而测试句子则由人工在考虑流畅性的前提下进行标注。我们推测训练语料中的这种差异会导致翻译模型性能下降。本文中,我们定义了“流畅性噪声(fluency noise)”以确定训练句子中导致其不自然的部分。我们表明,流畅性噪声可通过基于梯度的简单方法和预训练分类器来检测。通过去除训练句子中的流畅性噪声,我们的最终模型在 WMT-14 DE→EN 和 RU→EN 上优于基线。我们还展示了其与反向翻译增强的兼容性,反向翻译是常用于提升翻译模型流畅性的方法。最后,对流畅性噪声的定性分析提供了我们应关注要点的见解。
引用
@article{arxiv.2205.11826,
title = {Lack of Fluency is Hurting Your Translation Model},
author = {Jaehyo Yoo and Jaewoo Kang},
journal= {arXiv preprint arXiv:2205.11826},
year = {2022}
}
备注
10 pages, 2 figures