用于诱导 N-best 翻译词典的自动评估与统一滤波级联
cmp-lg
2008-02-03 v1 计算与语言
摘要
本文展示了如何使用语料库的统计特性以及四个外部知识来源,从双语语料中诱导 N-best 翻译词典。这些知识来源被建模为滤波器,以便在统一框架下级联任意子集。使用一种新的客观评估度量比较使用不同滤波级联诱导的词典质量。最佳滤波级联通过最高可达 137% 的提升显著优于纯粹基于统计的方法,接近人类水平。大幅度减少训练语料的大小对词典质量影响较小 when these knowledge sources 被使用。这使得在缺乏大型双语语料的语言对使用小型手工构建语料进行训练变得实用。此外,其中三个滤波器即使与大型训练语料一起使用也证明有用。
关键词
引用
@article{arxiv.cmp-lg/9505044,
title = {Automatic Evaluation and Uniform Filter Cascades for Inducing N-Best Translation Lexicons},
author = {I. Dan Melamed},
journal= {arXiv preprint arXiv:cmp-lg/9505044},
year = {2008}
}
备注
To appear in Proceedings of the Third Workshop on Very Large Corpora, 15 pages, uuencoded compressed PostScript