中文

基于浅层 CNN-HTSVM 架构的声学建模

声音 2017-06-29 v1 计算与语言

摘要

当缺乏大型数据集时,高准确率语音识别尤其具有挑战性。通过细致的、知识驱动的解析,结合受生物学启发的 CNN 以及 Vapnik Chervonenkis (VC) 理论的学习保证,有可能弥补这一差距。本工作提出一种浅层 CNN-HTSVM(层次树支持向量机分类器)架构,其使用预定义的基于知识的规则集与统计机器学习技术。我们在此表明,即便在最先进系统中存在的严重错误也可以避免,并且可以以层次化方式构建准确的声学模型。CNN-HTSVM 声学模型优于传统的 GMM-HMM 模型,且 HTSVM 结构优于 MLP 多类分类器。更重要的是,我们隔离了声学模型的性能,并在帧和音素级别上给出了考虑模型真实鲁棒性的结果。我们表明,即使使用少量数据,也能获得准确且鲁棒的识别率。

关键词

引用

@article{arxiv.1706.09055,
  title  = {Acoustic Modeling Using a Shallow CNN-HTSVM Architecture},
  author = {Christopher Dane Shulby and Martha Dais Ferreira and Rodrigo F. de Mello and Sandra Maria Aluisio},
  journal= {arXiv preprint arXiv:1706.09055},
  year   = {2017}
}

备注

Pre-review version of Bracis 2017