中文

一种高效归纳无监督语义标注器

cmp-lg 2008-02-03 v1 计算与语言

摘要

我们报告了开发一种简单而快速且高效的中文词语无监督语义标注器。使用了 348,000 词语的 POS 手工标注语料库。该标注器采用两步方法:第一步从语义词典(同义词词林)中选取可能的语义标注,结合 POS 以及语义由 POS 条件概率 P(S|P),第二步考虑当前词语前后语义标注以及由第一步推导的语义-词条件概率 P(S|W),并运用语义双词概率 P(S|S) 进行最终标注。最终的人工检查表明,该简单而高效的算法 achieves 91% 的命中率。该标注器在一台 120 MHz 的 Pentium 机器上使用 FOXPRO 运行时,处理速度为每秒 142 个词,速度是 Viterbi 标注器的 2.3 倍。

关键词

引用

@article{arxiv.cmp-lg/9606012,
  title  = {An Efficient Inductive Unsupervised Semantic Tagger},
  author = {K T Lua},
  journal= {arXiv preprint arXiv:cmp-lg/9606012},
  year   = {2008}
}

备注

uuencoded postscript file. email: cmp-lg/9606012