基于结构和统计音频纹理知识蒸馏的声学分类
声音
2026-03-25 v3 音频与语音处理
摘要
虽然知识蒸馏在各种音频任务中显示出成功,但在环境声学分类中常常忽视捕获复杂声学环境中局部模式所必需的低级音频纹理特征。为解决这一问题,提出了结构和统计音频纹理知识蒸馏框架(SSATKD),该框架将高级别上下文信息与从中间层提取的低级结构和统计音频纹理相结合。为评估其在多样化声学领域中的可通用性,在环境声学分类领域测试了四个数据集,包括两个被动声纳数据集(DeepShip 和 Vessel Type Underwater Acoustic Data (VTUAD))和两个通用环境声学数据集(Environmental Sound Classification 50 (ESC-50) 和 Tampere University of Technology (TUT) Acoustic Scenes)。探索了两种教师适应策略:仅分类器头适应和完全微调。该框架还使用各种卷积和基于变换器的教师模型进行评估。实验结果在所有数据集和设置下均显示出一致的准确率改进,确认了 SSATKD 在实际声学分类任务中的有效性和鲁棒性。
引用
@article{arxiv.2501.01921,
title = {Structural and Statistical Audio Texture Knowledge Distillation for Acoustic Classification},
author = {Jarin Ritu and Amirmohammad Mohammadi and Davelle Carreiro and Alexandra Van Dine and Joshua Peeples},
journal= {arXiv preprint arXiv:2501.01921},
year = {2026}
}
备注
13 pages, 6 figures