翻译等价性的词对词模型
cmp-lg
2007-05-23 v1 计算与语言
摘要
平行文本(双语文本)具有使其区别于其他类型并行数据的特性。首先,大多数词只翻译成另一个词。其次,双语文本的对应关系是带噪声的。本文提出了一些方法,用于引导统计翻译模型以反映这些特性。在稀疏数据条件下对这些偏差的预期行为进行分析,预测它们将产生更精确的模型。这一预测通过与金标准(gold standard)的评估得到了验证——以这种方式引入偏差的翻译模型显著优于一个缺乏先验知识的基线模型。本文还展示了统计翻译模型如何利用关于特定语言对的各类预先存在的知识。即使是最简单的语言特定知识,如实词与功能词的区分,也被证明能在某些任务上可靠地提升翻译模型性能。由关于模型域的预先存在的知识所指导的统计模型,结合了理性主义与经验主义传统的各自优势。
引用
@article{arxiv.cmp-lg/9805006,
title = {Word-to-Word Models of Translational Equivalence},
author = {I. Dan Melamed},
journal= {arXiv preprint arXiv:cmp-lg/9805006},
year = {2007}
}