中文

基于多任务学习的声音事件与声学场景联合分析

声音 2021-02-24 v1 音频与语音处理

摘要

声音事件检测(SED)与声学场景分类(ASC)是环境声音分析中的重要研究课题。许多研究组已使用基于神经网络的方法(如卷积神经网络(CNN)、循环神经网络(RNN)和卷积循环神经网络(CRNN))处理SED与ASC。传统方法将SED与ASC分开处理,尽管声音事件与声学场景密切相关。例如,在“办公室”声学场景中,很可能发生“鼠标点击”和“键盘敲击”声音事件。因此,声音事件与声学场景的信息有望相互辅助SED与ASC。本文提出用于声音事件与声学场景联合分析的多任务学习,其中共享网络中承载声音事件与声学场景共性信息的部分。使用 TUT Sound Events 2016/2017 和 TUT Acoustic Scenes 2016 数据集获得的实验结果表明,相比传统基于CRNN的方法,所提方法在F值上分别将SED与ASC性能提升1.31和1.80个百分点。

关键词

引用

@article{arxiv.2010.09213,
  title  = {Joint Analysis of Sound Events and Acoustic Scenes Using Multitask Learning},
  author = {Noriyuki Tonami and Keisuke Imoto and Ryosuke Yamanishi and Yoichi Yamashita},
  journal= {arXiv preprint arXiv:2010.09213},
  year   = {2021}
}

备注

Accepted to IEICE Transactions on Information and Systems. arXiv admin note: text overlap with arXiv:1904.12146