中文

基于卷积神经网络的城市声音标注

声音 2019-09-30 v1 机器学习 音频与语音处理

摘要

在本文中,我们提出了一种在低数据情境下(每类少于100个标注样本)进行环境声音分类的框架。我们表明,使用预训练的图像分类模型并结合数据增强技术的使用,相比替代方法可获得更高的性能。我们将该系统应用于DCASE 2019中的城市声音标注任务。其目标是从原始音频数据中标注不同的噪声源。我们训练了MobileNetV2的一种改进形式(一种卷积神经网络(CNN)模型)来联合分类粗粒度与细粒度标签。所提出的模型使用对数缩放的梅尔谱图作为音频数据的表示格式。Mixup、随机擦除、缩放和偏移被用作数据增强技术。我们还构建了第二个使用缩放标签的模型,以考虑标注中的人为误差。所提出的模型在排行榜上获得第一名,在细粒度和粗粒度标签上的Micro-AUPRC值分别为0.751和0.860。

关键词

引用

@article{arxiv.1909.12699,
  title  = {Urban Sound Tagging using Convolutional Neural Networks},
  author = {Sainath Adapa},
  journal= {arXiv preprint arXiv:1909.12699},
  year   = {2019}
}

备注

5 pages