Coursera语料挖掘与多阶段微调以改善讲座翻译
计算与语言
2020-01-15 v2 人工智能
机器学习
摘要
讲座翻译是口语翻译的一种情形,且缺乏公开可用的平行语料库。为此,我们考察了一个与语言无关的平行语料挖掘框架,这是一种从Coursera公开讲座中快速有效挖掘平行语料库的方法。我们的方法依靠机器翻译和连续空间句子表示上的余弦相似度来确定句子对齐。我们还展示了如何在基于多阶段微调的领域适配中使用所得语料库,以实现高质量的讲座翻译。对于日英讲座翻译,我们提取了约40,000行的平行数据,并通过人工过滤创建了开发和测试集以基准测试翻译性能。我们证明,当通过多阶段训练将挖掘的语料库与域外平行语料库结合使用时,可大幅提升翻译质量。本文还给出了一些收集与清洗语料库、挖掘平行句、处理挖掘数据中的噪声以及创建高质量评估切分的指导方针。为可复现起见,我们将发布用于平行数据创建的代码。
引用
@article{arxiv.1912.11739,
title = {Coursera Corpus Mining and Multistage Fine-Tuning for Improving Lectures Translation},
author = {Haiyue Song and Raj Dabre and Atsushi Fujita and Sadao Kurohashi},
journal= {arXiv preprint arXiv:1912.11739},
year = {2020}
}
备注
10 pages, 1 figure, 9 tables, under review by LREC2020