基于多任务学习的声音事件与声学场景联合分析
声音
2021-02-24 v1 音频与语音处理
摘要
声音事件检测(SED)与声学场景分类(ASC)是环境声音分析中的重要研究课题。许多研究组已使用基于神经网络的方法(如卷积神经网络(CNN)、循环神经网络(RNN)和卷积循环神经网络(CRNN))处理SED与ASC。传统方法将SED与ASC分开处理,尽管声音事件与声学场景密切相关。例如,在“办公室”声学场景中,很可能发生“鼠标点击”和“键盘敲击”声音事件。因此,声音事件与声学场景的信息有望相互辅助SED与ASC。本文提出用于声音事件与声学场景联合分析的多任务学习,其中共享网络中承载声音事件与声学场景共性信息的部分。使用 TUT Sound Events 2016/2017 和 TUT Acoustic Scenes 2016 数据集获得的实验结果表明,相比传统基于CRNN的方法,所提方法在F值上分别将SED与ASC性能提升1.31和1.80个百分点。
引用
@article{arxiv.2010.09213,
title = {Joint Analysis of Sound Events and Acoustic Scenes Using Multitask Learning},
author = {Noriyuki Tonami and Keisuke Imoto and Ryosuke Yamanishi and Yoichi Yamashita},
journal= {arXiv preprint arXiv:2010.09213},
year = {2021}
}
备注
Accepted to IEICE Transactions on Information and Systems. arXiv admin note: text overlap with arXiv:1904.12146