基于类时间与类频率卷积神经网络双线性池化的声学场景分类
音频与语音处理
2020-02-18 v1 机器学习
声音
机器学习
摘要
当前应对声学场景分类(ASC)任务的方法可概括为两步:将音频波形预处理为对数梅尔谱图,随后将其作为卷积神经网络(CNN)的输入表示。这一范式转变发生于 DCASE 2016 之后,该框架模型在(ESC-50)数据集上取得了 ASC 任务的 SOTA 结果,准确率达 64.5%,较基线模型提升 20.5%;在 DCASE 2016 数据集上开发集准确率为 90.0%、评测集为 86.2%,较基线系统分别提升 6.4% 和 9%。本文探索使用谐波与打击源分离(HPSS)将音频拆分为谐波音频与打击音频,该方法在音乐信息检索(MIR)领域已广受关注。尽管已有研究将 HPSS 用作 ASC 任务中 CNN 模型的输入表示,本文进一步探究利用分离出的谐波分量与打击分量的可能性:构建两个 CNN,分别以自然形式理解谐波音频与打击音频,一个专于提取时偏域深层特征,另一个专于提取频偏域深层特征。从这两个 CNN 提取的深层特征随后通过双线性池化结合。从而提出一种双流时间与频率 CNN 架构方法用于声学场景分类。该模型在 DCASE 2019 子任务 1a 数据集上评估,开发集平均得分 65%,以及 Kaggle 私有与公开排行榜。
引用
@article{arxiv.2002.07065,
title = {Acoustic Scene Classification Using Bilinear Pooling on Time-liked and Frequency-liked Convolution Neural Network},
author = {Xing Yong Kek and Cheng Siong Chin and Ye Li},
journal= {arXiv preprint arXiv:2002.07065},
year = {2020}
}
备注
inclusion in conference proceedings 2019 IEEE Symposium Series on Computational Intelligence (IEEE SSCI 2019), Xiamen