中文

基于可分离模型的快速按例查询语音搜索

音频与语音处理 2021-09-21 v1 信息检索 声音

摘要

传统的按例查询(QbE)语音搜索方法通常使用基于帧级特征的方法,而最先进的方法倾向于使用基于声学词嵌入(AWEs)的模型,将变长音频信号转换为定长特征向量表示。然而,这些方法无法同时满足搜索质量与速度的要求。本文提出一种基于可分离模型的新型快速QbE语音搜索方法以解决该问题。首先,引入一个QbE语音搜索训练框架。其次,我们设计了一种基于RepVGG的新型模型推理方案,可有效提升QbE搜索质量。第三,我们根据所提模型推理方案修改并改进了我们的QbE语音搜索模型。在关键词数据集上的实验表明,仅应用可分离模型方案,我们的方法就能将GPU实时因子(RTF)从1/150提升至1/2300,并优于其他最先进方法。

关键词

引用

@article{arxiv.2109.08870,
  title  = {Fast query-by-example speech search using separable model},
  author = {Yuguang Yang and Yu Pan and Xin Dong and Minqiang Xu},
  journal= {arXiv preprint arXiv:2109.08870},
  year   = {2021}
}

备注

8pages, 8 figures