中文

通过聚类训练句子来提高语言模型性能

cmp-lg 2008-02-03 v1 计算与语言

摘要

许多用于语音理解的语言模型在对句内语境影响的建模方面存在不完美。我认为,这一问题可以通过对训练语料库中的句子进行自动聚类(以熵减少为标准)来解决,并为每个簇计算独立的语言模型参数。这种聚类方式可以表示重要的语境效应,从而显著提高模型的性能。它还提供了一个相对自动化的方式来收集证据,以判断是否值得开发更复杂、具有上下文敏感性的模型(使用相同的基本类型的语言信息):如果聚类能够提高模型的性能,这就证明了存在进一步的上下文依赖关系,这些依赖关系尚未被未聚类模型所利用。为了支持这些论点,我展示了结果,表明聚类对某些模型有效,但对其他模型无效。这些结果与其他此类模型的发现相一致,这表明聚类是否带来改进确实是判断是否值得进一步发展未聚类模型的良好指标。

关键词

引用

@article{arxiv.cmp-lg/9410001,
  title  = {Improving Language Models by Clustering Training Sentences},
  author = {David Carter},
  journal= {arXiv preprint arXiv:cmp-lg/9410001},
  year   = {2008}
}

备注

Expanded version of a paper to appear in ANLP-94, Stuttgart. Latex, 7 pages. Needs latex-acl.sty