用于声音分类的堆叠特征表示与音频频谱转换器模型评估
音频与语音处理
2026-02-25 v2 声音
摘要
环境声分类(ESC)因其在智慧城市监测、故障检测、声学监视和制造质量控制等多样化应用而受到广泛关注。为提升CNN性能,已探索特征堆叠技术,将互补声学描述符聚合为更丰富的输入表示。本文研究了采用多种堆叠特征组合的CNN模型,包括对数梅尔频谱图(LM)、频谱对比(SPC)、色度图(CH)、Tonnetz(TZ)、梅尔频率倒谱系数(MFCCs)和Gamatone倒谱系数(GTCC)。在不同训练方案下(包括在ESC-50上预训练、在UrbanSound8K上微调、以及与AudioSet等大规模语料预训练的AST模型进行比较)在ESC-50和UrbanSound8K数据集上进行实验。这种实验设计使我们能够分析在不同训练数据水平和预训练多样性下,特征堆叠CNN与转换器模型之间的比较。结果表明,在缺乏大规模预训练或广泛训练数据时,特征堆叠CNN提供了更具计算和数据效率的替代方案,特别适用于资源受限和边缘级别的声音分类场景。
引用
@article{arxiv.2602.09321,
title = {Evaluating CNN with Stacked Feature Representations and Audio Spectrogram Transformer Models for Sound Classification},
author = {Parinaz Binandeh Dehaghania and Danilo Penab and A. Pedro Aguiar},
journal= {arXiv preprint arXiv:2602.09321},
year = {2026}
}
备注
13 pages, 9 figures