德语文本语料库中 V-N 短语搭配抽取可行性研究
cmp-lg
2016-08-15 v1 计算与语言
摘要
评估 Church 等人 (1991) 提出的统计方法对从德语文本语料库中抽取动词-名词 (V-N) 搭配的有用性。讨论该方法由于德语特性而产生的一些问题,并考虑各种可能改进该方法以提高德语搭配抽取结果的方法。评估所有变体方法在包含支持动词的 V-N 搭配中的精确率和召回率,并讨论对从德语语料库中抽取搭配的进一步工作的影响。在语料库足够大 (>= 600 万词) 时,最严格的方法的平均错误率可降低至 2.2% (97.8% 精确率),但与较宽松的方法相比,数据损失近 50%,而后者仍保持 87.6% 的精确率。根据实现目标,强调可为 lexicographic 目的提供高召回率,或为自动词汇获取提供高精确率,每种情况都会导致相应变量的下降。若语料库非常大 (即 50 - 10000 万词) 或使用专门领域的语料库(除机器可读 (搭配) 词典中发现的数据之外),则低召回率仍可接受。
引用
@article{arxiv.cmp-lg/9603006,
title = {Extraction of V-N-Collocations from Text Corpora: A Feasibility Study for German},
author = {Elisabeth Breidt},
journal= {arXiv preprint arXiv:cmp-lg/9603006},
year = {2016}
}
备注
12 pages, revised version of paper presented at 1st ACL-Workshop on Very Large Corpora, Columbus, Ohio, June 1993