中文

一种更快的结构化标签词分类方法

cmp-lg 2008-02-03 v1 计算与语言

摘要

已提出多种方法用于处理语料库以诱导出该语料库所代表子语言的标签集。本文研究了 McMahon(1994)提出的一种结构化标签词分类方法,该方法在 McMahon & Smith(1995)的 cmp-lg/9503011 中被进一步讨论。两种主要变体——(1)非随机初始词类分配和(2)并行移动多个词——共同提供了鲁棒的非随机结果,速度提升了 200% 至 450%,代价是略低于 McMahon 方法平均质量。另外两种变体——(3)保留低频词信息和(4)避免重新聚类封闭类——被提出供进一步研究。注意:上述速度提升是相对于我对 McMahon 算法的理解实现而言的;这在个人电脑上耗时数小时甚至数天。McMahon & Smith(1995)论文的修订版已于 1996 年 6 月发表在 Computational Linguistics 22(2):217-247 上;该论文提到在 Sparc-IPC 上聚类 569 个词耗时"数周"。

关键词

引用

@article{arxiv.cmp-lg/9610004,
  title  = {A Faster Structured-Tag Word-Classification Method},
  author = {Min Zhang},
  journal= {arXiv preprint arXiv:cmp-lg/9610004},
  year   = {2008}
}

备注

10 pages, Microsoft Word 6.0, ps