中文

从连续语音中获取词汇表的无监督获取

cmp-lg 2008-02-03 v1 计算与语言

摘要

我们提出了一种无监督学习算法,从原始语音中获取自然语言词汇表。该算法基于MDL框架中符号序列的最优编码,并使用语言的层次表示,克服了许多之前语法诱导程序所面临的难题。从符号序列到语音流的前向映射使用基于语音手势的特征建模。我们present了从原始语音、文本和 phonetic 转录中获取词汇表和语言模型的结果,证明该算法在分段性能和统计效率方面与其他报告结果相当 favorable。

关键词

引用

@article{arxiv.cmp-lg/9512002,
  title  = {The Unsupervised Acquisition of a Lexicon from Continuous Speech},
  author = {Carl de Marcken},
  journal= {arXiv preprint arXiv:cmp-lg/9512002},
  year   = {2008}
}

备注

27 page technical report