中文

DcaseNet:一种用于检测与分类声学场景和事件的集成预训练深度神经网络

音频与语音处理 2021-02-09 v4

摘要

尽管声学场景与事件包含许多相关任务,但其联合检测与分类甚少被研究。我们提出三种深度神经网络架构,它们被集成以同时执行声学场景分类、音频标注与声音事件检测。前两种架构受人类认知过程启发:第一种架构类似于成人对场景分类的短期感知,即先检测各种声音事件再用以识别声学场景;第二种架构类似于婴儿的长期使用学习,也是自监督学习背后的概念——婴儿先观察重力等抽象概念的作用,再借助此类感知学习具体任务。第三种架构在第二种之上添加少量层,在对应输出层之前仅执行单一任务。我们旨在构建一个可作为预训练模型来执行上述三项任务的集成系统。在三个数据集上的实验表明,所提名为DcaseNet的架构既可直接用于任一任务且给出合适结果,也可微调以提升某一任务性能。代码与预训练DcaseNet权重见https://github.com/Jungjee/DcaseNet。

关键词

引用

@article{arxiv.2009.09642,
  title  = {DcaseNet: An integrated pretrained deep neural network for detecting and classifying acoustic scenes and events},
  author = {Jee-weon Jung and Hye-jin Shim and Ju-ho Kim and Ha-Jin Yu},
  journal= {arXiv preprint arXiv:2009.09642},
  year   = {2021}
}

备注

5 pages, 1 figure, 3 tables. accepted for presentation at ICASSP 2021 as a conference paper