用于声事件检测的起始与结束加权损失函数
声音
2024-03-21 v1 音频与语音处理
摘要
在典型的声事件检测 (SED) 系统中,在帧级别检测声事件的存在,并将检测到具有相同事件的连续帧合并为一个声事件。中值滤波器作为后处理步骤被应用,以尽可能多地消除检测错误。然而,发生在声事件起始和结束附近的检测错误超出了中值滤波器的能力范围。为了解决这个问题,本文提出了一种起始和结束加权二元交叉熵 (OWBCE) 损失函数,该函数训练 DNN 模型使其在起始和结束附近的帧上更加鲁棒。实验在 DCASE 2022 任务 4 的背景下进行。结果表明,当考虑不同的模型时,OWBCE 优于 BCE。对于基本的 CRNN,OWBCE 可以在 event-F1 上实现 6.43% 的相对改进,在 PSDS1 上实现 1.96% 的相对改进,在 PSDS2 上实现 2.43% 的相对改进。
引用
@article{arxiv.2403.13254,
title = {Onset and offset weighted loss function for sound event detection},
author = {Tao Song},
journal= {arXiv preprint arXiv:2403.13254},
year = {2024}
}