中文

基于大间隔分解 CNN 的声学场景分类

声音 2019-10-16 v1 机器学习 音频与语音处理 机器学习

摘要

本文提出一种基于大间隔分解卷积神经网络(CNN)的声学场景分类框架。我们采用分解 CNN,通过将二维核分解为两个独立的一维核来学习时频域中的模式。分解核有助于学习两类模式的主要成分:长期环境声与短期事件声,它们是音频场景分类的关键模式。在训练模型时,我们采用基于三元组采样的损失函数,使得来自不同环境的同一音频场景样本被最小化,同时不同音频场景样本被最大化。借助该损失函数,同一音频场景的样本与环境无关地聚为一类,从而我们得到在未知环境中具有更好泛化能力的分类器。我们使用 DCASE 2019 challenge task1A 的数据集评估了我们的音频场景分类框架。实验结果表明,所提算法提升了基线网络的性能,并将参数量减少至三分之一。此外,在未知数据上的性能增益更高,表明所提算法具有更好的泛化能力。

关键词

引用

@article{arxiv.1910.06784,
  title  = {Acoustic Scene Classification Based on a Large-margin Factorized CNN},
  author = {Janghoon Cho and Sungrack Yun and Hyoungwoo Park and Jungyun Eum and Kyuwoong Hwang},
  journal= {arXiv preprint arXiv:1910.06784},
  year   = {2019}
}

备注

5 pages, DCASE 2019 Workshop