基于噪声无关的多任务 Whisper 训练用于降低呼救检测的误报率
声音
2025-01-22 v1 人工智能
音频与语音处理
摘要
关键词点识别通常通过关键词分类器实现,该分类器作用于声学模型的编码器,从而实现对预定义或开放词汇关键词的分类。尽管关键词点识别是各类应用中的关键任务,可扩展至紧急情况下的呼救检测,但以往方法常因需为新关键词引入 retraining 或适应变化情境而受限于可扩展性。我们探索了一种简单而有效的方法,利用即插即用的预训练语音识别模型来应对这些挑战,尤其是在呼救检测场景中。此外,我们观察到在实际场景中部署呼救检测系统时,由于麦克风或不同环境引入的噪声,会导致误报率显著增加。为此,我们提出了一种新颖的噪声无关多任务学习方法,将噪声分类头集成到语音识别编码器中。该方法增强了模型对噪声环境的鲁棒性,从而显著降低了误报率并提升了整体呼救性能。尽管增加了多任务学习的复杂度,我们的方法仍具备计算效率,为实际场景中的呼救检测提供了有前景的解决方案。
引用
@article{arxiv.2501.11631,
title = {Noise-Agnostic Multitask Whisper Training for Reducing False Alarm Errors in Call-for-Help Detection},
author = {Myeonghoon Ryu and June-Woo Kim and Minseok Oh and Suji Lee and Han Park},
journal= {arXiv preprint arXiv:2501.11631},
year = {2025}
}
备注
Accepted to ICASSP 2025