基于Transformer的MFCC音频分类序列标注方法
声音
2023-07-06 v2 计算机视觉与模式识别
音频与语音处理
摘要
音频分类在语音与音乐识别等领域至关重要。从音频信号中提取特征(如梅尔谱图和MFCC)是音频分类的关键步骤。这些特征被转换为谱图用于分类。研究者已探索了多种技术,包括传统机器学习和深度学习方法对谱图进行分类,但这些方法计算开销可能较大。为简化该过程,可采用受自然语言处理中序列分类启发的更直接方法。本文提出一种基于Transformer编码器的模型,利用MFCC进行音频分类。该模型在ESC-50、Speech Commands v0.02和UrbanSound8k数据集上进行了基准测试,表现出强劲性能,在UrbanSound8k数据集上训练时取得95.2%的最高准确率。该模型仅含127,544个总参数,轻量且在音频分类任务上高效。
引用
@article{arxiv.2305.00417,
title = {Transformer-based Sequence Labeling for Audio Classification based on MFCCs},
author = {C. S. Sonali and Chinmayi B S and Ahana Balasubramanian},
journal= {arXiv preprint arXiv:2305.00417},
year = {2023}
}
备注
Error in the explanation as well inadequate results and conclusion