稀疏二值化用于快速关键词检测
音频与语音处理
2025-04-29 v1 机器学习
声音
摘要
随着语音激活设备和应用的日益普及,关键词检测(KWS)模型使用户能够无需手部操作地与技术进行交互,在 various contexts 中提升便利性和可达性。将 KWS 模型部署到边缘设备(如智能手机和嵌入式系统)对于实时应用、隐私保护和带宽效率具有显著优势。然而,这些设备通常计算能力和内存有限。这 necessitates 优化神经网络模型以提高效率,而不显著牺牲其准确性。为解决这些挑战,我们提出一种基于稀疏输入表示后接线性分类器的新型关键词检测模型。该模型相较于前一种适用于边缘设备的 state-of-the-art 模型速度提升四倍,同时准确率更高。我们展示了该方法在噪声环境中也更具鲁棒性且快速高效。我们的代码已公开:https://github.com/jsvir/sparknet。
引用
@article{arxiv.2406.06634,
title = {Sparse Binarization for Fast Keyword Spotting},
author = {Jonathan Svirsky and Uri Shaham and Ofir Lindenbaum},
journal= {arXiv preprint arXiv:2406.06634},
year = {2025}
}