基于大间隔分解 CNN 的声学场景分类
声音
2019-10-16 v1 机器学习
音频与语音处理
机器学习
摘要
本文提出一种基于大间隔分解卷积神经网络(CNN)的声学场景分类框架。我们采用分解 CNN,通过将二维核分解为两个独立的一维核来学习时频域中的模式。分解核有助于学习两类模式的主要成分:长期环境声与短期事件声,它们是音频场景分类的关键模式。在训练模型时,我们采用基于三元组采样的损失函数,使得来自不同环境的同一音频场景样本被最小化,同时不同音频场景样本被最大化。借助该损失函数,同一音频场景的样本与环境无关地聚为一类,从而我们得到在未知环境中具有更好泛化能力的分类器。我们使用 DCASE 2019 challenge task1A 的数据集评估了我们的音频场景分类框架。实验结果表明,所提算法提升了基线网络的性能,并将参数量减少至三分之一。此外,在未知数据上的性能增益更高,表明所提算法具有更好的泛化能力。
引用
@article{arxiv.1910.06784,
title = {Acoustic Scene Classification Based on a Large-margin Factorized CNN},
author = {Janghoon Cho and Sungrack Yun and Hyoungwoo Park and Jungyun Eum and Kyuwoong Hwang},
journal= {arXiv preprint arXiv:1910.06784},
year = {2019}
}
备注
5 pages, DCASE 2019 Workshop