中文

面向音频标注、声音事件检测与空间定位的跨任务学习:DCASE 2019 基线系统

声音 2019-04-16 v2 音频与语音处理

摘要

声学场景与事件的检测和分类(DCASE)2019 挑战赛重点关注音频标注、声音事件检测和空间定位。DCASE 2019 包含五个任务:1) 声学场景分类,2) 带有噪声标签和最小监督的音频标注,3) 声音事件定位与检测,4) 家庭环境中的声音事件检测,以及 5) 城市声音标注。在本文中,我们提出了基于卷积神经网络(CNN)的通用跨任务基线系统。其动机是在不利用任务特定特征的情况下,研究各种模型在多个任务上的性能。我们考察了具有 5、9 和 13 层的 CNN,发现最优架构依赖于具体任务。对于我们考虑的系统,我们发现具有平均池化的 9 层 CNN 是大多数 DCASE 2019 任务的良好模型。

关键词

引用

@article{arxiv.1904.05635,
  title  = {Cross-task learning for audio tagging, sound event detection spatial localization: DCASE 2019 baseline systems},
  author = {Qiuqiang Kong and Yin Cao and Turab Iqbal and Yong Xu and Wenwu Wang and Mark D. Plumbley},
  journal= {arXiv preprint arXiv:1904.05635},
  year   = {2019}
}

备注

We want to replace but create this submission by mistake. See arXiv:1904.03476 instead