中文

一种高效且概率上可靠的分割与词发现算法

计算与语言 2007-05-23 v1 机器学习

摘要

本文提出一种基于模型的无监督算法,用于从已删除词边界的自然语言文本中恢复词边界。该算法源于生成该文本的信源的概率模型。模型的基本结构被抽象地指定,以便音系、词序与词频的详细组件模型可以模块化方式替换。基于输入由固定但未知词典中的词拼接生成这一假设,该模型给出了给定字母表上所有可能词的所有可能序列的语言无关先验概率分布。该模型的独特之处在于,它将无论长度如何的完整语料库的生成视为概率空间中的单一事件。相应地,该算法不估计词上的概率分布;而是尝试计算可能构成观测文本的各类词序列的先验概率。对父母对幼儿自发语音的音素转写的实验表明,该算法比其他已提出的算法更有效,至少在给定话语边界且文本含大量短话语时如此。关键词:贝叶斯语法归纳,概率模型,最小描述长度 (MDL),无监督学习,认知建模,语言习得,分割

关键词

引用

@article{arxiv.cs/9905007,
  title  = {An Efficient, Probabilistically Sound Algorithm for Segmentation and Word Discovery},
  author = {Michael R. Brent},
  journal= {arXiv preprint arXiv:cs/9905007},
  year   = {2007}
}

备注

65 double-spaced ms. pages including 3 figures