中文

无监督词性归纳中的词库建模

计算与语言 2014-02-27 v1

摘要

自动归纳文本中单词的句法词性类别是计算语言学中的一项基本任务。虽然无监督标注模型的性能一直在缓慢提升,但当前最先进的系统做出了一个明显错误的假设,即给定词型的所有词符必须共享单个词性标签。这种“每词型一标签”的启发式方法抵消了基于隐马尔可夫模型 (Hidden Markov Model) 的标注器为给定词型过度生成标签的倾向。然而,这显然与基本句法理论不相容。在本文中,我们将最先进的 Pitman-Yor 隐马尔可夫模型标注器扩展为包含显式的词库模型。借此,我们能够引入一种软偏置,倾向于为每个词型诱导较少的标签。我们开发了一种粒子滤波器用于从模型后验中抽取样本,并展示了实证结果,表明我们的模型在不施加任何不切实际限制的情况下,具有与最先进系统相当的竞争力且速度更快。

关键词

引用

@article{arxiv.1402.6516,
  title  = {Modelling the Lexicon in Unsupervised Part of Speech Induction},
  author = {Greg Dubbin and Phil Blunsom},
  journal= {arXiv preprint arXiv:1402.6516},
  year   = {2014}
}

备注

To be presented at the 14th Conference of the European Chapter of the Association for Computational Linguistics