探索利用 Paracrawl 进行文档级神经机器翻译
计算与语言
2023-04-21 v1
摘要
文档级神经机器翻译(NMT)在多个数据集上已优于句子级 NMT。然而,文档级 NMT 仍未在真实翻译系统中被广泛采用,主要原因在于缺乏大规模的通用领域文档级 NMT 训练数据。我们考察了使用 Paracrawl 来学习文档级翻译的有效性。Paracrawl 是一个从互联网爬取的大规模平行语料库,包含来自多个领域的数据。官方 Paracrawl 语料库以平行句子(从平行网页中提取)的形式发布,因此先前工作仅将 Paracrawl 用于学习句子级翻译。在本工作中,我们利用自动句子对齐从 Paracrawl 平行网页中提取平行段落,并将提取的平行段落作为平行文档来训练文档级翻译模型。我们表明,仅使用 Paracrawl 中的平行段落训练的文档级 NMT 模型可用于翻译来自 TED、News 和 Europarl 的真实文档,优于句子级 NMT 模型。我们还进行了针对性的代词评测,并表明使用 Paracrawl 数据训练的文档级模型有助于上下文感知的代词翻译。
引用
@article{arxiv.2304.10216,
title = {Exploring Paracrawl for Document-level Neural Machine Translation},
author = {Yusser Al Ghussin and Jingyi Zhang and Josef van Genabith},
journal= {arXiv preprint arXiv:2304.10216},
year = {2023}
}
备注
Accepted to EACL 2023