重新思考用于音频分类的CNN模型
计算机视觉与模式识别
2020-11-17 v2 声音
音频与语音处理
摘要
在本文中,我们展示了ImageNet预训练的标准深度CNN模型可用作音频分类的强基线网络。尽管音频频谱图与标准ImageNet图像样本之间存在显著差异,迁移学习的假设仍然牢固成立。为理解是什么使ImageNet预训练模型能够学习有用的音频表示,我们系统地研究了预训练权重中有多少对学习频谱图是有用的。我们表明(1)对于给定的标准模型,使用预训练权重优于使用随机初始化权重(2)通过可视化梯度给出CNN从频谱图学习内容的定性结果。此外,我们表明即使使用预训练模型权重进行初始化,同一模型多次输出运行中的性能仍存在方差。这种性能方差源于线性分类层的随机初始化以及多次运行中的随机小批量排序。这带来了显著的多样性,可构建更强的集成模型,从而整体提升准确率。一个ImageNet预训练的DenseNet在ESC-50数据集上达到92.89%验证准确率,在UrbanSound8K数据集上达到87.42%验证准确率,这是目前这两个数据集上的最优结果(SOTA)。
引用
@article{arxiv.2007.11154,
title = {Rethinking CNN Models for Audio Classification},
author = {Kamalesh Palanisamy and Dipika Singhania and Angela Yao},
journal= {arXiv preprint arXiv:2007.11154},
year = {2020}
}
备注
8 pages, 3 figures