中文

面向音频标注、声音事件检测与空间定位的跨任务学习:DCASE 2019基线系统

声音 2019-06-11 v4 音频与语音处理

摘要

声音场景与事件检测与分类(DCASE)2019挑战赛聚焦于音频标注、声音事件检测与空间定位。DCASE 2019包含五项任务:1)声学场景分类,2)带噪声标签与最小监督的音频标注,3)声音事件定位与检测,4)家庭环境中的声音事件检测,以及5)城市声音标注。本文中,我们提出基于卷积神经网络(CNNs)的通用跨任务基线系统。其动机在于考察多种模型在若干音频识别任务上的表现,而不利用各任务的特定性质。我们考察了具有5、9和13层的CNN,发现最优架构依赖于具体任务。对于我们考虑的系统,发现带有卷积层后平均池化的9层CNN是大多数DCASE 2019任务的良好模型。

关键词

引用

@article{arxiv.1904.03476,
  title  = {Cross-task learning for audio tagging, sound event detection and spatial localization: DCASE 2019 baseline systems},
  author = {Qiuqiang Kong and Yin Cao and Turab Iqbal and Yong Xu and Wenwu Wang and Mark D. Plumbley},
  journal= {arXiv preprint arXiv:1904.03476},
  year   = {2019}
}

备注

5 pages