基于对比损失的逐帧特征解耦用于多音事件检测
声音
2024-01-12 v1 音频与语音处理
摘要
重叠声音事件在现实环境中无处不在,但现有的端到端声音事件检测(SED)方法在有效检测它们方面仍存在困难。一个关键原因是这些方法使用共享且纠缠的逐帧特征来表示重叠事件,这降低了特征的区分度。为解决此问题,我们提出了一种解耦特征学习框架,以学习类别特定的表示。具体而言,我们采用不同的投影器来学习每个类别的逐帧特征。为确保这些特征不包含其他类别的信息,我们最大化同一类别内逐帧特征之间的共同信息,并提出了一种逐帧对比损失。此外,考虑到所提方法使用的标注数据有限,我们提出了一种半监督逐帧对比损失,可利用大量未标注数据实现特征解耦。实验结果证明了我们方法的有效性。
引用
@article{arxiv.2401.05850,
title = {Contrastive Loss Based Frame-wise Feature disentanglement for Polyphonic Sound Event Detection},
author = {Yadong Guan and Jiqing Han and Hongwei Song and Wenjie Song and Guibin Zheng and Tieran Zheng and Yongjun He},
journal= {arXiv preprint arXiv:2401.05850},
year = {2024}
}
备注
accepted by icassp2024