利用带软场景标签的声音事件与场景多任务学习进行声音事件检测
声音
2020-02-17 v1 音频与语音处理
摘要
声音事件检测(SED)和声学场景分类(ASC)是环境声音分析中的主要任务。考虑到声音事件与场景彼此密切相关,一些工作已基于多任务学习(MTL)处理声音事件与声学场景的联合分析,其中声音事件与场景的知识可相互辅助估计。传统的基于MTL的方法利用独热场景标签来训练声音事件与场景之间的关系;因此,传统方法无法建模声音事件与场景相关的程度。然而,在真实环境中,常见声音事件可能出现在某些声学场景中;另一方面,某些声音事件仅出现在有限的声学场景中。因此,本文提出一种基于SED与ASC的MTL并使用声学场景软标签的SED新方法,其使我们能够建模声音事件与场景相关的程度。使用TUT Sound Events 2016/2017和TUT Acoustic Scenes 2016数据集进行的实验表明,与传统的基于MTL的SED相比,所提出的方法在F-score上提升了3.80%的SED性能。
引用
@article{arxiv.2002.05848,
title = {Sound Event Detection by Multitask Learning of Sound Events and Scenes with Soft Scene Labels},
author = {Keisuke Imoto and Noriyuki Tonami and Yuma Koizumi and Masahiro Yasuda and Ryosuke Yamanishi and Yoichi Yamashita},
journal= {arXiv preprint arXiv:2002.05848},
year = {2020}
}
备注
Accepted to ICASSP 2020