从连续语音中获取词汇表的无监督获取
cmp-lg
2008-02-03 v1 计算与语言
摘要
我们提出了一种无监督学习算法,从原始语音中获取自然语言词汇表。该算法基于MDL框架中符号序列的最优编码,并使用语言的层次表示,克服了许多之前语法诱导程序所面临的难题。从符号序列到语音流的前向映射使用基于语音手势的特征建模。我们present了从原始语音、文本和 phonetic 转录中获取词汇表和语言模型的结果,证明该算法在分段性能和统计效率方面与其他报告结果相当 favorable。
引用
@article{arxiv.cmp-lg/9512002,
title = {The Unsupervised Acquisition of a Lexicon from Continuous Speech},
author = {Carl de Marcken},
journal= {arXiv preprint arXiv:cmp-lg/9512002},
year = {2008}
}
备注
27 page technical report