中文

声学场景与声音事件信息如何相互促进事件检测与场景分类任务

声音 2022-04-06 v1 音频与语音处理

摘要

声学场景分类(ASC)与声音事件检测(SED)是环境声音分析中的基础任务,已有许多基于深度学习的方法被提出。考虑到声学场景与声音事件的信息可相互助力 SED 与 ASC,一些研究者已通过多任务学习(MTL)提出对声学场景与声音事件进行联合分析。然而,以往工作未详细探究声学场景与声音事件如何相互促进 SED 与 ASC。因此,我们利用基于梯度反转层(GRL)的域对抗训练或使用伪标签的模型训练,考察声学场景与声音事件的信息对 SED 与 ASC 性能的影响。使用 TUT Acoustic Scenes 2016/2017 与 TUT Sound Events 2016/2017 得到的实验结果表明,声学场景与声音事件的信息可分别被有效用于检测声音事件与分类声学场景。此外,将基于 GRL 与伪标签的方法同基于单任务的 ASC 与 SED 方法比较后发现,基于单任务的方法取得了更好性能。该结果表明,即便使用基于单任务的 ASC 与 SED 方法,声学场景信息也可能被隐式地用于 SED,反之亦然。

关键词

引用

@article{arxiv.2204.02279,
  title  = {How Information on Acoustic Scenes and Sound Events Mutually Benefits Event Detection and Scene Classification Tasks},
  author = {Keisuke Imoto and Yuka Komatsu and Shunsuke Tsubaki and Tatsuya Komatsu},
  journal= {arXiv preprint arXiv:2204.02279},
  year   = {2022}
}

备注

Submitted to INTERSPEECH 2022