中文

利用奖励建模学习特征权重以去噪平行语料库

计算与语言 2021-03-15 v1

摘要

大规模网络爬取语料库是提升神经机器翻译(NMT)系统在多种语言对上性能的极佳资源。然而,由于这些语料库通常极其嘈杂,其使用相当有限。当前应对该问题的方法主要集中于使用启发式规则或单一特征(如语言模型分数或双语相似度)进行过滤。本工作提出一种替代方法,学习多个句子级特征的权重。这些特征权重直接针对提升翻译性能这一任务进行优化,用于更有效地为嘈杂语料库中的句子打分和过滤。我们给出了将该技术应用于使用 Paracrawl 语料库构建爱沙尼亚语-英语 NMT 系统的结果,并显示它击败了强力的单特征基线和人工设计的组合。此外,我们分析了该方法对不同类型噪声的敏感性,并借助马耳他语-英语 Paracrawl 语料库探究所学权重是否能泛化到其他语言对。

关键词

引用

@article{arxiv.2103.06968,
  title  = {Learning Feature Weights using Reward Modeling for Denoising Parallel Corpora},
  author = {Gaurav Kumar and Philipp Koehn and Sanjeev Khudanpur},
  journal= {arXiv preprint arXiv:2103.06968},
  year   = {2021}
}

备注

10 pages, 2 figures