基于谱图处理策略的声学场景分类
声音
2020-07-09 v1 音频与语音处理
摘要
近年来,卷积神经网络(CNN)在声学场景分类(ASC)任务中取得了最先进的性能。音频数据通常被转换为二维谱图表示,然后输入神经网络。本文研究了通过判别性处理策略高效利用不同谱图表示的问题。主要贡献有两点。第一点贡献是探索了在多个阶段组合多种谱图表示的影响,为有效的谱图融合提供了有意义的参考。第二点贡献是提出了多频带和多时间帧的处理策略,以充分利用单一谱图表示。所提出的谱图处理策略可轻松迁移到任意网络结构。实验在 DCASE 2020 Task1 数据集上进行,结果表明,在官方提供的 Task1A 和 Task1B 的 fold 1 评估数据集上,我们的方法分别达到了 81.8%(官方基线:54.1%)和 92.1%(官方基线:87.3%)的准确率。
引用
@article{arxiv.2007.03781,
title = {Acoustic Scene Classification with Spectrogram Processing Strategies},
author = {Helin Wang and Yuexian Zou and Dading Chong},
journal= {arXiv preprint arXiv:2007.03781},
year = {2020}
}
备注
Submitted to DCASE 2020 Workshop