中文

IIT Bombay 英印地语平行语料库

计算与语言 2018-05-22 v2

摘要

我们发布IIT Bombay英印地语平行语料库。该语料库汇集了先前在公共领域可用的平行语料库以及我们新收集的平行语料库。该语料库包含149万平行句段,其中69.4万句段此前未在公共领域公开。该语料库已针对机器翻译进行了预处理,我们报告了基于短语的统计机器翻译和神经机器翻译在该语料库上的基线翻译结果。该语料库已在亚洲语言翻译研讨会(2016年和2017年)的两届共享任务中使用。该语料库可免费用于非商业研究。据我们所知,这是目前最大的公开可用英印地语平行语料库。

关键词

引用

@article{arxiv.1710.02855,
  title  = {The IIT Bombay English-Hindi Parallel Corpus},
  author = {Anoop Kunchukuttan and Pratik Mehta and Pushpak Bhattacharyya},
  journal= {arXiv preprint arXiv:1710.02855},
  year   = {2018}
}

备注

accepted for LREC 2018, 4 pages, parallel corpus for English-Hindi machine translation