中文

基于音频-文本匹配潜在编码的关键词 spotting

音频与语音处理 2023-06-09 v1 机器学习 声音

摘要

联合使用音频和文本嵌入进行关键词 spotting(KWS)已展现出高质量结果,但如何对不同序列长度的多词关键词的两种嵌入进行语义对齐这一关键挑战在很大程度上仍未解决。在本文中,我们提出了一种基于音频-文本的端到端灵活关键词 spotting(KWS)模型架构,其构建于学习到的音频和文本嵌入之上。我们的架构使用一种新颖的基于动态规划的算法——动态序列划分(DSP),利用语音内容的单调对齐将音频序列最优划分为与基于词文本序列相同的长度。我们提出的模型由一个用于获取音频和文本嵌入的编码器块、一个将各嵌入投影到公共潜在空间的项目器块,以及一个包含新颖 DSP 算法的音频-文本对齐器组成,该对齐器对齐音频和文本嵌入以确定语音内容是否与文本相同。实验结果表明,我们的 DSP 比其他划分方案更有效,并且所提架构在公开数据集上以 ROC 曲线下面积(AUC)和等错误率(EER)分别优于最先进结果 14.4% 和 28.9%。

关键词

引用

@article{arxiv.2306.05245,
  title  = {Matching Latent Encoding for Audio-Text based Keyword Spotting},
  author = {Kumari Nishu and Minsik Cho and Devang Naik},
  journal= {arXiv preprint arXiv:2306.05245},
  year   = {2023}
}