基于 CNN 的多频谱图融合与标签扩展的声学场景分类
计算机视觉与模式识别
2018-09-06 v1
摘要
频谱图已广泛应用于基于卷积神经网络的声学场景分类方案中,如 STFT 频谱图和 MFCC 频谱图等。它们具有不同的时频特性,在识别声学场景时各有优缺点。在本文中,提出了一种新颖的多频谱图融合框架,使各频谱图相互补充。在该框架中,将单一 CNN 架构应用于多个频谱图以进行特征提取。然后融合从多个频谱图中提取的深度特征以区分声学场景。此外,受声学场景数据集中类间相似性的启发,进一步提出了一种标签扩展方法,在原始类别上构建超类标签。在扩展标签的帮助下,通过附加超类分类的辅助任务,将 CNN 模型转换为多任务学习形式以改进声学场景分类。为验证所提方法的有效性,在 DCASE2017 和 LITIS Rouen 数据集上进行了大量实验。实验结果表明,所提方法在两个数据集上均能取得有前景的准确率。具体而言,LITIS Rouen 数据集、DCASE 开发集和评估集的准确率分别达到 0.9744、0.8865 和 0.7778。
引用
@article{arxiv.1809.01543,
title = {CNNs-based Acoustic Scene Classification using Multi-Spectrogram Fusion and Label Expansions},
author = {Weiping Zheng and Zhenyao Mo and Xiaotao Xing and Gansen Zhao},
journal= {arXiv preprint arXiv:1809.01543},
year = {2018}
}