基于CNN的声学场景分类方法比较研究
声音
2023-05-10 v1 人工智能
计算机视觉与模式识别
音频与语音处理
摘要
声学场景分类是从声音记录中刻画并分类环境的过程。第一步是从记录的声音中生成特征(表示),然后对环境背景进行分类。然而,不同种类的表示对分类精度有显著影响。本文中,我们利用神经网络探究了三种此类表示对分类精度的影响。我们使用不同的CNN网络和自编码器研究了谱图、MFCC和嵌入表示。我们的数据集由室内和室外三种设置下的声音组成——因此该数据集包含六种不同环境类型的声音。我们发现谱图表示的分类精度最高,而MFCC的分类精度最低。我们报告了我们的发现、见解以及利用声音实现更好环境分类的一些指导方针。
引用
@article{arxiv.2204.12177,
title = {A Comparative Study on Approaches to Acoustic Scene Classification using CNNs},
author = {Ishrat Jahan Ananya and Sarah Suad and Shadab Hafiz Choudhury and Mohammad Ashrafuzzaman Khan},
journal= {arXiv preprint arXiv:2204.12177},
year = {2023}
}
备注
Presented at 2021 Mexican International Conference on Artificial Intelligence. Published in Advances in Computational Intelligence, MICAI 2021, Lecture Notes in Computer Science. 12 pages, 3 figures, 5 tables