基于词汇标准的英汉平行语料库统计对齐
cmp-lg
2016-08-31 v1 计算与语言
摘要
我们描述了在英汉平行文本中自动对齐句子的经验。本报告涉及三个相关主题:(1) 香港科技大学英汉平行双语语料库的进展;(2) 探讨 Gale & Church 的基于长度的统计方法在涉及非印欧语系语言的对齐任务中的适用性;(3) 一种改进的统计方法,该方法还结合了领域特定的词汇线索。
引用
@article{arxiv.cmp-lg/9406007,
title = {Aligning a Parallel English-Chinese Corpus Statistically with Lexical Criteria},
author = {Dekai Wu},
journal= {arXiv preprint arXiv:cmp-lg/9406007},
year = {2016}
}
备注
8 pages, uuencoded compressed PostScript