中文

基于加权循环一致生成对抗网络的无监督特征学习用于环境声音分类

机器学习 2019-11-26 v2 声音 音频与语音处理 机器学习

摘要

本文提出一种新颖的环境声音分类方法,结合通过球形 KK-Means++ 算法从码本进行的无监督特征学习,以及一种用于高层数据增强的新架构。音频信号使用离散小波变换(DWT)转换为二维表示。随后,DWT 谱图通过一种新颖的循环一致生成对抗网络架构进行增强。该高层增强通过在样本间平移结构特征,以类内与类间方式引导生成谱图。通过使用加速鲁棒特征检测器(SURF)与 K-Means++ 算法对 DWT 谱图进行编码来构建码本。随机森林是我们最终的学习算法,它从码本中的聚类码字学习环境声音分类任务。在四个基准环境声音数据集(ESC-10、ESC-50、UrbanSound8k 与 DCASE-2017)上的实验结果表明,所提出的分类方法在范围内优于现有最优分类器,包括先进且密集的卷积神经网络如 AlexNet 与 GoogLeNet,根据数据集不同将分类率提升了 3.51% 至 14.34%。

关键词

引用

@article{arxiv.1904.04221,
  title  = {Unsupervised Feature Learning for Environmental Sound Classification Using Weighted Cycle-Consistent Generative Adversarial Network},
  author = {Mohammad Esmaeilpour and Patrick Cardinal and Alessandro Lameiras Koerich},
  journal= {arXiv preprint arXiv:1904.04221},
  year   = {2019}
}

备注

Paper Accepted for Publication in Elsevier Applied Soft Computing