中文

唤醒与否:通过逐次细化降低关键词误报

信号处理 2023-04-10 v1 机器学习 声音 音频与语音处理

摘要

关键词唤醒系统持续处理音频流以检测关键词。设计此类系统最具挑战性的任务之一是降低误报,即当关键词未被说出时系统错误地记录了关键词。在本文中,我们针对该问题提出了一种简单而优雅的解决方案,该方案源自全概率律。我们表明,可以通过逐次细化来改进现有的深度关键词唤醒机制,即系统首先分类输入音频是否为语音,接着分类输入是否类似于关键词,最后分类说出了哪个关键词。我们展示了在参数规模从 13K 到 2.41M 的多个模型中,逐次细化技术在域内留出误报数据上将误报最多降低了 8 倍,在域外误报数据上最多降低了 7 倍。此外,我们提出的方法是“即插即用”的,可应用于任何深度关键词唤醒模型。

关键词

引用

@article{arxiv.2304.03416,
  title  = {To Wake-up or Not to Wake-up: Reducing Keyword False Alarm by Successive Refinement},
  author = {Yashas Malur Saidutta and Rakshith Sharma Srinivasa and Ching-Hua Lee and Chouchang Yang and Yilin Shen and Hongxia Jin},
  journal= {arXiv preprint arXiv:2304.03416},
  year   = {2023}
}

备注

Accepted for publication in ICASSP 2023