中文

结合音频判别的对比学习用于连续语音中的可定制关键词检测

音频与语音处理 2024-01-15 v1 声音

摘要

由于在现实世界中的应用潜力,连续语音中的可定制关键词检测(KWS)日益受到关注。虽然对比学习(CL)已被广泛用于提取关键词表征,但先前的 CL 方法均作用于预分割的孤立词,且仅采用音频-文本表征匹配策略。然而,对于连续语音中的 KWS,协同发音和流式分词很容易为不同文本产生相似的音频模式,从而可能引发误报。为解决这一问题,我们提出了一种结合音频判别的新型对比学习(CLAD)方法,以学习同时具备音频-文本匹配和音频-音频判别能力的关键词表征。在此,训练期间每个滑动窗口均采用了同时考虑音频-音频和音频-文本 CL 数据对的 InfoNCE 损失。在开源的 LibriPhrase 数据集上的评估表明,使用滑动窗口级别的 InfoNCE 损失获得了与先前 CL 方法相当的性能。此外,在连续语音数据集 LibriSpeech 上的实验表明,通过引入音频判别,CLAD 相比无音频判别的 CL 获得了显著的性能提升。同时,与两阶段 KWS 方法相比,结合 CLAD 的端到端 KWS 不仅取得了更好的性能,还实现了显著加速。

关键词

引用

@article{arxiv.2401.06485,
  title  = {Contrastive Learning With Audio Discrimination For Customizable Keyword Spotting In Continuous Speech},
  author = {Yu Xi and Baochen Yang and Hao Li and Jiaqi Guo and Kai Yu},
  journal= {arXiv preprint arXiv:2401.06485},
  year   = {2024}
}

备注

Accepted by ICASSP2024