中文

面向唱歌语境的鲁棒语音活动检测

音频与语音处理 2025-12-11 v1

摘要

语音活动检测(SAD)系统常在包含唱歌的语境下误分类唱歌为语音,导致诸如对话增强与自动语音识别等应用性能下降。我们引入一种称为 SR-SAD(Singing-Robust Speech Activity Detection,唱歌鲁棒语音活动检测)的神经网络,用于在包含唱歌时可靠地检测语音。我们的主要贡献包括:i) 采用受控语音与唱歌样本比例进行训练,以提高判别能力;ii) 具备计算效率的模型,在保持鲁棒性能的同时显著降低推理运行时间;iii) 一种新颖的评估指标,旨在评估混合语音-唱歌情境下的 SAD 鲁棒性。实验在覆盖多个音乐流派的具挑战性数据集上进行,结果表明 SR-SAD 能实现高语音检测准确率(AUC=0.919),同时有效拒绝唱歌。通过显式学习区分语音与唱歌,SR-SAD 使混合语音-唱歌情境下的 SAD 更加可靠。

关键词

引用

@article{arxiv.2512.09713,
  title  = {Robust Speech Activity Detection in the Presence of Singing Voice},
  author = {Philipp Grundhuber and Mhd Modar Halimeh and Martin Strauß and Emanuël A. P. Habets},
  journal= {arXiv preprint arXiv:2512.09713},
  year   = {2025}
}

备注

This paper has been published in: 2025 IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (WASPAA)