面向通用声音分类数据无关知识蒸馏的特征丰富音频模型反演
声音
2023-03-15 v1 人工智能
音频与语音处理
摘要
数据无关知识蒸馏(DFKD)近来引起学术界越来越多的关注,尤其在计算机视觉领域取得重大突破。尽管结果可观,该技术尚未很好地应用于音频与信号处理。由于音频信号时长可变,其建模方式有独特之处。在本工作中,我们提出特征丰富音频模型反演(FRAMI),一种面向通用声音分类任务的数据无关知识蒸馏框架。它首先通过特征不变对比损失生成高质量且特征丰富的梅尔频谱图。然后,在对这些特征丰富样本进行知识蒸馏时,复用统计池化层前后的隐藏状态。在 Urbansound8k、ESC-50 和 audioMNIST 数据集上的实验结果表明,FRAMI 能生成特征丰富样本。同时,通过复用隐藏状态进一步提升了学生模型的精度,并显著优于基线方法。
引用
@article{arxiv.2303.07643,
title = {Feature-Rich Audio Model Inversion for Data-Free Knowledge Distillation Towards General Sound Classification},
author = {Zuheng Kang and Yayun He and Jianzong Wang and Junqing Peng and Xiaoyang Qu and Jing Xiao},
journal= {arXiv preprint arXiv:2303.07643},
year = {2023}
}
备注
Accepted by ICASSP 2023. International Conference on Acoustics, Speech and Signal Processing (ICASSP 2023)