中文

用于改进动物音频分类的数据增强方法

机器学习 2020-03-17 v2 声音 音频与语音处理 机器学习

摘要

本文提出用于自动化动物音频分类的分类器集成,利用不同数据增强技术训练卷积神经网络 (CNNs)。具体的动物音频分类问题为 i) 鸟类与 ii) 猫叫声,其数据集可免费获取。我们在原始数据集及经四种增强协议(作用于原始音频信号或其谱图表示)增广的版本上训练五种不同的 CNN。我们将最佳方法与现有最优方法比较,表明在相同数据集上无需专门参数优化即取得最佳识别率。我们的研究表明可训练不同 CNN 用于动物音频分类,且其融合优于独立分类器。据我们所知,这是使用相同分类器与参数集在动物音频分类音频数据集上关于 CNN 数据增强的最大规模研究。我们的 MATLAB 代码见 https://github.com/LorisNanni。

关键词

引用

@article{arxiv.1912.07756,
  title  = {Data augmentation approaches for improving animal audio classification},
  author = {Loris Nanni and Gianluca Maguolo and Michelangelo Paci},
  journal= {arXiv preprint arXiv:1912.07756},
  year   = {2020}
}