中文

基于弱标注数据的声学场景与声音事件联合分析

声音 2022-07-12 v1 音频与语音处理

摘要

考虑到声学场景与声音事件彼此密切相关,一些先前论文提出了利用基于多任务学习(MTL)的神经网络对声学场景与声音事件进行联合分析。在常规方法中,MTL 模型中对声音事件检测采用强监督方案,这需要在模型训练中提供声音事件的强标签;然而,标注强事件标签十分耗时。因此,本文提出一种基于 MTL 框架、利用声音事件弱标签的声学场景与声音事件联合分析方法。具体而言,在所提方法中,我们引入多示例学习方案用于声音事件检测的弱监督训练,并评估了四种池化函数,即最大池化、平均池化、指数 softmax 池化和注意力池化。使用 TUT Acoustic Scenes 2016/2017 与 TUT Sound Events 2016/2017 数据集部分数据获得的实验结果表明,所提基于弱标签的 MTL 方法在场景分类与事件检测性能上均优于常规的基于弱标签的单任务场景分类与事件检测模型。

关键词

引用

@article{arxiv.2207.04357,
  title  = {Joint Analysis of Acoustic Scenes and Sound Events with Weakly labeled Data},
  author = {Shunsuke Tsubaki and Keisuke Imoto and Nobutaka Ono},
  journal= {arXiv preprint arXiv:2207.04357},
  year   = {2022}
}

备注

Accepted to IWAENC2022