scb-mt-en-th-2020:一个大型英泰平行语料库
计算与语言
2021-08-10 v1
摘要
我们工作的主要目标是构建一个用于机器翻译的大规模英泰数据集。我们构建了一个包含超过 100 万句段对的英泰机器翻译数据集,其来源于新闻、维基百科文章、短信、基于任务的对话、网络爬取数据以及政府文件等多种渠道。我们以可复现的方式呈现数据收集、构建平行文本以及去除噪声句对的方法。我们基于该数据集训练机器翻译模型。我们的模型在泰英翻译上的性能可与 Google Translation API(截至 2020 年 5 月)相媲美,而当训练数据中纳入 Open Parallel Corpus (OPUS) 时,在泰英和英泰翻译上均优于 Google。该数据集、预训练模型以及用于复现我们工作的源代码均已公开供使用。
引用
@article{arxiv.2007.03541,
title = {scb-mt-en-th-2020: A Large English-Thai Parallel Corpus},
author = {Lalita Lowphansirikul and Charin Polpanumas and Attapol T. Rutherford and Sarana Nutanong},
journal= {arXiv preprint arXiv:2007.03541},
year = {2021}
}
备注
35 pages, 4 figures