中文

统计语言模型的扩展聚类算法

cmp-lg 2008-02-03 v1 计算与语言

摘要

统计语言模型常常面临训练数据不足的问题。由于聚类可以减少需要训练的自由参数数量,这一问题可被缓解。然而,聚类模型存在以下缺点:如果存在足够的数据来训练非聚类模型,则聚类版本可能表现更差。在当前使用的数据建模语料库(例如《华尔街日报》语料库)上,聚类模型与非聚类模型的性能如何比较?在尝试回答这一问题的过程中,我们发展了以下两个想法:首先,为了获得潜在高性能的聚类算法,扩展了一个现有算法以处理更高阶的 N 元语法。其次,为了更有效地对大量训练数据进行聚类,提出了一种加速该算法的启发式方法。所得出的聚类算法可用于对《华尔街日报》语料库上的三元组进行聚类,由此产生的语言模型可与现有的回退模型竞争。尤其当训练数据有限时,聚类模型显著优于回退模型。

关键词

引用

@article{arxiv.cmp-lg/9412003,
  title  = {An Extended Clustering Algorithm for Statistical Language Models},
  author = {Joerg P. Ueberla},
  journal= {arXiv preprint arXiv:cmp-lg/9412003},
  year   = {2008}
}

备注

27 pages, latex, comments welcome