中文

达罗毗荼语言的无监督机器翻译

计算与语言 2021-03-31 v1 人工智能

摘要

无监督神经机器翻译(UNMT)尤其有益于低资源语言,例如达罗毗荼语系的语言。然而,UNMT系统在实际涉及真实低资源语言的场景中往往失败。近期工作提出利用辅助平行数据并取得了最先进的结果。在本工作中,我们关注英语与卡纳达语(一种低资源达罗毗荼语言)之间的无监督翻译。我们还额外利用了英语与其他相关达罗毗荼语言之间有限数量的辅助数据。我们表明,统一文字系统对于达罗毗荼语言之间的无监督翻译至关重要。我们探索了若干利用辅助数据的模型架构,以最大化知识共享并实现远距离语言对的无监督神经机器翻译。我们的实验证明,纳入与我们的目标语言卡纳达语相似的辅助语言至关重要。此外,我们提出了一种衡量语言相似度的度量,并表明它可作为选择辅助语言的良好指标。

关键词

引用

@article{arxiv.2103.15877,
  title  = {Unsupervised Machine Translation On Dravidian Languages},
  author = {Sai Koneru and Danni Liu and Jan Niehues},
  journal= {arXiv preprint arXiv:2103.15877},
  year   = {2021}
}