基于语言查询声源分离的噪声鲁棒声事件检测与计数
声音
2025-08-12 v1 音频与语音处理
摘要
大多数声事件检测(SED)系统在干净数据集上表现良好,但在噪声环境中性能显著下降。语言查询音频源分离(LASS)模型通过分离目标事件显示出鲁棒性,但现有方法需要复杂的多阶段训练,且缺乏对目标事件的明确指导。为此,本文引入事件外观检测(EAD),一种基于计数的方法在 clip 级别和 frame 级别计数事件 occurrences。基于 EAD,我们提出一种基于 co-training 的多任务学习框架,用于 EAD 和 SED,以增强 SED 在噪声环境中的性能。首先,SED 难以学习与 EAD 相同的模式。然后,设计一种基于任务的约束以提高 SED 与 EAD 之间的预测一致性。该框架为 LASS 模型提供更可靠的 clip 级别预测,并强化了时间戳检测能力。在 DESED 和 WildDESED 数据集上的实验表明,与现有方法相比,本方法在所有噪声水平上均取得更好的性能。
引用
@article{arxiv.2508.07176,
title = {Noise-Robust Sound Event Detection and Counting via Language-Queried Sound Separation},
author = {Yuanjian Chen and Yang Xiao and Han Yin and Yadong Guan and Xubo Liu},
journal= {arXiv preprint arXiv:2508.07176},
year = {2025}
}