用于高效低资源音频分类的变分信息瓶颈
声音
2021-07-13 v1 音频与语音处理
摘要
卷积神经网络(CNNs)等大规模深度神经网络(DNNs)凭借其强大的容量和强泛化能力,在音频分类中取得了令人印象深刻的性能。然而,在低资源任务上训练 DNN 模型时,通常容易过拟合小数据并学到过多冗余信息。为解决此问题,我们提出使用变分信息瓶颈(VIB)来缓解过拟合并抑制无关信息。本工作中,我们在一个 4 层 CNN 上进行实验。但 VIB 框架即插即用,可轻易用于许多其他最先进的网络架构。在若干音频数据集上的评估表明,我们的方法显著优于基线方法,在某些低资源设定下分类准确率提升超过 5.0%。
引用
@article{arxiv.2107.04803,
title = {Variational Information Bottleneck for Effective Low-resource Audio Classification},
author = {Shijing Si and Jianzong Wang and Huiming Sun and Jianhan Wu and Chuanyao Zhang and Xiaoyang Qu and Ning Cheng and Lei Chen and Jing Xiao},
journal= {arXiv preprint arXiv:2107.04803},
year = {2021}
}
备注
Accepted by InterSpeech 2021