预训练模型中音频滤波器对环境声音分类影响的研究
声音
2024-08-27 v1 人工智能
音频与语音处理
摘要
环境声音分类是声音识别中的一个重要问题,且比语音识别更复杂,因为环境声音在时间和频率上结构不规整。过去几年,研究人员使用各种CNN模型从音频文件生成的不同音频特征(如对数梅尔频谱图、伽马通频谱系数、梅尔频率倒谱系数)中学习音频特征。我们提出了一种新方法:两级分类;第一级分类器负责将音频信号分类为更广泛的类别,第二级分类器负责根据第一级分类器的输出确定音频所属的具体类别。我们还展示了不同音频滤波器的影响,其中本文引入了一种新方法——音频裁剪,在大多数情况下取得了最高准确率。我们使用ESC-50数据集进行实验,在第一级分类中取得了78.75%的最高准确率,在第二级分类中取得了98.04%的最高准确率。
引用
@article{arxiv.2408.13644,
title = {Studying the Effect of Audio Filters in Pre-Trained Models for Environmental Sound Classification},
author = {Aditya Dawn and Wazib Ansar},
journal= {arXiv preprint arXiv:2408.13644},
year = {2024}
}
备注
19 pages, 16 figures