唤醒与否:通过逐次细化降低关键词误报
信号处理
2023-04-10 v1 机器学习
声音
音频与语音处理
摘要
关键词唤醒系统持续处理音频流以检测关键词。设计此类系统最具挑战性的任务之一是降低误报,即当关键词未被说出时系统错误地记录了关键词。在本文中,我们针对该问题提出了一种简单而优雅的解决方案,该方案源自全概率律。我们表明,可以通过逐次细化来改进现有的深度关键词唤醒机制,即系统首先分类输入音频是否为语音,接着分类输入是否类似于关键词,最后分类说出了哪个关键词。我们展示了在参数规模从 13K 到 2.41M 的多个模型中,逐次细化技术在域内留出误报数据上将误报最多降低了 8 倍,在域外误报数据上最多降低了 7 倍。此外,我们提出的方法是“即插即用”的,可应用于任何深度关键词唤醒模型。
引用
@article{arxiv.2304.03416,
title = {To Wake-up or Not to Wake-up: Reducing Keyword False Alarm by Successive Refinement},
author = {Yashas Malur Saidutta and Rakshith Sharma Srinivasa and Ching-Hua Lee and Chouchang Yang and Yilin Shen and Hongxia Jin},
journal= {arXiv preprint arXiv:2304.03416},
year = {2023}
}
备注
Accepted for publication in ICASSP 2023