中文

低频同形词的词汇先验概率估计

cmp-lg 2008-02-03 v1 计算与语言

摘要

给定一个此前未见过的、在形态上具有n义歧义的(syncretic forms)形式,对于该形式各种功能的词汇先验概率(lexical priors),最佳估计器是什么?我们认为,最佳估计器是通过计算单现词(hapax legomena)——即在语料库中恰好出现一次的形式——中各种功能的相对频率来提供的。这一结果对开发随机形态标注器(stochastic morphological taggers)具有重要影响,特别是在需要对语料库进行一些初始人工标注(hand-tagging)时:对于预测极低频的形态歧义类型(这些类型大多不会出现在任何给定的语料库中)的词汇先验概率,人们应该集中精力标注单现词的代表性样本,而不是广泛标注所有频率范围的词汇。

关键词

引用

@article{arxiv.cmp-lg/9504015,
  title  = {Estimating Lexical Priors for Low-Frequency Syncretic Forms},
  author = {Harald Baayen and Richard Sproat},
  journal= {arXiv preprint arXiv:cmp-lg/9504015},
  year   = {2008}
}

备注

Submitted to Computational Linguistics