中文

基于双向预翻译与多数投票的双语文本检索方法

计算与语言 2021-03-15 v2 人工智能 机器学习

摘要

获取高质量平行语料对于训练神经机器翻译(NMT)系统至关重要。然而,由于许多语言对缺乏充足的黄金标准训练数据,一种流行的方法是从两种语言的配对文档中挖掘所谓的“伪平行”句对。本文指出了当前方法存在的一些问题,提出了计算代价低廉的解决方案,并在 Tatoeba 相似度检索基准以及一个下游任务(即 NMT)上通过新方法证明了其有效性。我们揭示了资源相关因素(即给定语言可用的单语/双语数据量)对双语文本挖掘方法最优选择的影响,并呼应了他人观察到的常用 BUCC 数据集存在的问题。我们将实验所用的代码和数据公开可用。

关键词

引用

@article{arxiv.2103.06369,
  title  = {Majority Voting with Bidirectional Pre-translation For Bitext Retrieval},
  author = {Alex Jones and Derry Tanti Wijaya},
  journal= {arXiv preprint arXiv:2103.06369},
  year   = {2021}
}