基于双向预翻译与多数投票的双语文本检索方法
计算与语言
2021-03-15 v2 人工智能
机器学习
摘要
获取高质量平行语料对于训练神经机器翻译(NMT)系统至关重要。然而,由于许多语言对缺乏充足的黄金标准训练数据,一种流行的方法是从两种语言的配对文档中挖掘所谓的“伪平行”句对。本文指出了当前方法存在的一些问题,提出了计算代价低廉的解决方案,并在 Tatoeba 相似度检索基准以及一个下游任务(即 NMT)上通过新方法证明了其有效性。我们揭示了资源相关因素(即给定语言可用的单语/双语数据量)对双语文本挖掘方法最优选择的影响,并呼应了他人观察到的常用 BUCC 数据集存在的问题。我们将实验所用的代码和数据公开可用。
引用
@article{arxiv.2103.06369,
title = {Majority Voting with Bidirectional Pre-translation For Bitext Retrieval},
author = {Alex Jones and Derry Tanti Wijaya},
journal= {arXiv preprint arXiv:2103.06369},
year = {2021}
}