从平行数据中自动发现非组合复合词
cmp-lg
2008-02-03 v1 计算与语言
摘要
将文本自动切分为最小语义承载单元即使对英语这样的语言也是一个未解决的问题。词间的空格提供了一个简单的初步近似,但这一近似对于机器翻译(MT)来说不够好,因为在MT中许多词序列并非逐词翻译。本文提出了一种高效的自动方法,用于发现作为整体进行翻译的词序列。该方法通过比较从两种语言的平行文本中诱导出的统计翻译模型对来运作。每次迭代可以发现数百个非组合复合词,并从较短的复合词构建较长的复合词。在一个简单的机器翻译任务上的客观评估表明,该方法有潜力提升MT输出质量。该方法对数据做出的假设很少,因此可以应用于平行文本以外的平行数据,如单词拼写和发音。
引用
@article{arxiv.cmp-lg/9706027,
title = {Automatic Discovery of Non-Compositional Compounds in Parallel Data},
author = {I. Dan Melamed},
journal= {arXiv preprint arXiv:cmp-lg/9706027},
year = {2008}
}
备注
12 pages; uses natbib.sty, here.sty