中文

基于多语言瓶颈特征、面向近乎零资源语言的免ASR的CNN-DTW关键词 spotting

计算与语言 2018-07-24 v1 机器学习

摘要

我们考虑将多语言瓶颈特征(BNFs)用于近乎零资源的关键词 spotting。这是一个联合国项目的一部分,利用关键词 spotting 来支持非洲部分地区语言资源极度匮乏的人道主义救援项目。我们使用1920个孤立关键词(40类,34分钟)作为动态时间规整(DTW)模板匹配的示例,该匹配在一大段未转写的语音上进行。这些DTW代价被用作卷积神经网络(CNN)关键词 spotter 的训练目标,从而得到比直接DTW快得多的系统。在此我们考虑如何利用资源充足语言的可用数据来改进这一CNN-DTW方法。我们表明,在十种语言上训练的多语言BNFs相较于MFCC基线,将CNN-DTW系统的ROC曲线下面积绝对提升了10.9%。通过将低资源的基于DTW的监督与资源充足语言的信息相结合,CNN-DTW成为低资源关键词 spotting 的一个有竞争力的方案。

关键词

引用

@article{arxiv.1807.08666,
  title  = {ASR-free CNN-DTW keyword spotting using multilingual bottleneck features for almost zero-resource languages},
  author = {Raghav Menon and Herman Kamper and Emre Yilmaz and John Quinn and Thomas Niesler},
  journal= {arXiv preprint arXiv:1807.08666},
  year   = {2018}
}

备注

5 pages, 3 figures, 3 tables, 1 equation accepted at SLTU 2018