用于示例查询口语词检测的多语言瓶颈特征
计算与语言
2019-07-02 v1 人机交互
机器学习
声音
音频与语音处理
摘要
示例查询口语词检测(QbE-STD)的最先进解决方案通常依赖于查询和音频文档的瓶颈特征表示来执行基于动态时间规整(DTW)的模板匹配。在此,我们针对使用从前馈网络提取的若干单语言以及多语言瓶颈特征的QbE-STD性能展开研究。然后,我们提出采用残差网络(ResNet)来估计瓶颈特征,并显示出相对于相应基于前馈网络的特征的显著改进。神经网络在GlobalPhone语料库上训练,QbE-STD实验在一个极具挑战性的QUESST 2014数据库上进行。
引用
@article{arxiv.1907.00443,
title = {Multilingual Bottleneck Features for Query by Example Spoken Term Detection},
author = {Dhananjay Ram and Lesly Miculicich and Hervé Bourlard},
journal= {arXiv preprint arXiv:1907.00443},
year = {2019}
}