学习频谱图时间分辨率用于音频分类
声音
2024-01-15 v3 人工智能
多媒体
音频与语音处理
信号处理
摘要
音频频谱图是一种时频表示,已广泛用于音频分类。音频频谱图的关键属性之一是时间分辨率,其取决于短时傅里叶变换 (STFT) 中使用的跳距。以往工作通常假设跳距应为常数(例如 10 ms)。然而,固定的时间分辨率对于不同类型的声音并非总是最优。时间分辨率不仅影响分类精度,也影响计算成本。本文提出一种新方法 DiffRes,可实现用于音频分类的可微分时间分辨率建模。给定以固定跳距计算的频谱图,DiffRes 合并非关键时间帧同时保留重要帧。DiffRes 作为音频频谱图与分类器之间的“即插即用”模块,可与分类任务联合优化。我们在五个音频分类任务上评估 DiffRes,使用梅尔频谱图作为声学特征,并采用现成的分类器骨干网络。与使用固定时间分辨率的先前方法相比,基于 DiffRes 的方法能以至少 25% 的计算成本降低取得相当或更好的分类精度。我们进一步表明,DiffRes 可通过提高输入声学特征的时间分辨率来提升分类精度,且不增加计算成本。
引用
@article{arxiv.2210.01719,
title = {Learning Temporal Resolution in Spectrogram for Audio Classification},
author = {Haohe Liu and Xubo Liu and Qiuqiang Kong and Wenwu Wang and Mark D. Plumbley},
journal= {arXiv preprint arXiv:2210.01719},
year = {2024}
}
备注
Accepted by the 38th Annual AAAI Conference on Artificial Intelligence