中文

统计机器翻译中的词重排序综述:计算模型与语言现象

计算与语言 2017-02-27 v2

摘要

词重排序是统计机器翻译(SMT)最困难的方面之一,也是其质量和效率的重要因素。尽管迄今发表了大量研究,社区对此问题的兴趣未减,并且没有单一方法在不同语言对间表现出强烈主导。相反,新翻译任务的最优方法选择似乎仍主要由经验试验驱动。为引导读者在这一广阔复杂的研究领域,我们提出对词重排序作为统计建模挑战和作为自然语言现象的全面调查。该调查详细描述在不同基于字符串和基于树的SMT框架内以及作为独立任务如何建模词重排序,包括高级重排序建模文献的系统性概述。然后我们探究为何某些方法在不同语言对中比其它更成功。我们认为,除了测量重排序量,理解给定语言对中发生哪些种类的重排序很重要。为此,我们基于大量语言知识集合对多样化语言对样本中的词重排序现象进行定性分析。SMT文献中的经验结果显示支持假设:少数语言事实可非常有助于预期语言对的重排序特征并选择最适合的SMT框架。

关键词

引用

@article{arxiv.1502.04938,
  title  = {A Survey of Word Reordering in Statistical Machine Translation: Computational Models and Language Phenomena},
  author = {Arianna Bisazza and Marcello Federico},
  journal= {arXiv preprint arXiv:1502.04938},
  year   = {2017}
}

备注

44 pages, to appear in Computational Linguistics