中文

面向印度语言的统计机器翻译:Mission Hindi

计算与语言 2016-10-25 v1

摘要

本文讨论了孟买先进计算发展中心(CDACM)提交给 2014 年印度语言统计机器翻译(ILSMT)NLP 工具竞赛(与 ICON 2014 同地举办)的工作。该竞赛的目的是探索统计机器翻译(SMT)在印度语到印度语以及英语-印地语机器翻译中的有效性。在本文中,我们提出,对于从黏着语到印地语的 SMT,后缀分离和词拆分相比基线(BL)有显著提升。我们还表明,带有重排序的因子模型在英语-印地语(\enhi)翻译中优于基于短语的 SMT。我们报告了在所有五个语言对上的工作,即孟加拉语-印地语(\bnhi)、马拉地语-印地语(\mrhi)、泰米尔语-印地语(\tahi)、泰卢固语-印地语(\tehi)和 \enhi,涵盖健康、旅游和通用领域。

关键词

引用

@article{arxiv.1610.07418,
  title  = {Statistical Machine Translation for Indian Languages: Mission Hindi},
  author = {Raj Nath Patel and Prakash B. Pimpale and Sasikumar M},
  journal= {arXiv preprint arXiv:1610.07418},
  year   = {2016}
}

备注

5 pages, Published at NLP Tools Contest: Statistical Machine Translation in Indian Languages, ICON-2015