低频同形词的词汇先验概率估计
cmp-lg
2008-02-03 v1 计算与语言
摘要
给定一个此前未见过的、在形态上具有n义歧义的(syncretic forms)形式,对于该形式各种功能的词汇先验概率(lexical priors),最佳估计器是什么?我们认为,最佳估计器是通过计算单现词(hapax legomena)——即在语料库中恰好出现一次的形式——中各种功能的相对频率来提供的。这一结果对开发随机形态标注器(stochastic morphological taggers)具有重要影响,特别是在需要对语料库进行一些初始人工标注(hand-tagging)时:对于预测极低频的形态歧义类型(这些类型大多不会出现在任何给定的语料库中)的词汇先验概率,人们应该集中精力标注单现词的代表性样本,而不是广泛标注所有频率范围的词汇。
关键词
引用
@article{arxiv.cmp-lg/9504015,
title = {Estimating Lexical Priors for Low-Frequency Syncretic Forms},
author = {Harald Baayen and Richard Sproat},
journal= {arXiv preprint arXiv:cmp-lg/9504015},
year = {2008}
}
备注
Submitted to Computational Linguistics