基于可分离模型的快速按例查询语音搜索
音频与语音处理
2021-09-21 v1 信息检索
声音
摘要
传统的按例查询(QbE)语音搜索方法通常使用基于帧级特征的方法,而最先进的方法倾向于使用基于声学词嵌入(AWEs)的模型,将变长音频信号转换为定长特征向量表示。然而,这些方法无法同时满足搜索质量与速度的要求。本文提出一种基于可分离模型的新型快速QbE语音搜索方法以解决该问题。首先,引入一个QbE语音搜索训练框架。其次,我们设计了一种基于RepVGG的新型模型推理方案,可有效提升QbE搜索质量。第三,我们根据所提模型推理方案修改并改进了我们的QbE语音搜索模型。在关键词数据集上的实验表明,仅应用可分离模型方案,我们的方法就能将GPU实时因子(RTF)从1/150提升至1/2300,并优于其他最先进方法。
引用
@article{arxiv.2109.08870,
title = {Fast query-by-example speech search using separable model},
author = {Yuguang Yang and Yu Pan and Xin Dong and Minqiang Xu},
journal= {arXiv preprint arXiv:2109.08870},
year = {2021}
}
备注
8pages, 8 figures