通过融合预训练模型的多层特征构建通用音频表示
音频与语音处理
2022-05-18 v1 声音
摘要
许多应用研究依赖在大规模数据集上预训练的音频深度神经网络模型作为基础特征提取器,并通常从最后几层提取特征。在本研究中,我们关注一个发现:对于某些任务,现有监督预训练模型的中间层特征比后期层特征更有效。我们提出一种简单方法来构建适用于通用目的的有效特征,该方法包含两个步骤:(1) 从中间层/后期层输出沿时间帧计算特征向量,(2) 将它们融合。此方法提高了下游处理中频率和通道信息的效用,并结合了中间层和后期层特征在不同任务上的有效性。结果,所得特征向量对通用目的变得有效。在使用VGGish、PANNs的CNN14和AST在九个下游任务上的实验中,我们首先展示了这些模型各层输出服务于不同任务。然后,我们证明所提出的方法显著提升了它们的性能,并将其提升至与当前最优水平相当的程度。特别是,非语义语音(NOSS)任务的性能大幅提升,在使用VGGish的Speech Commands V2上提升了+77.1(从14.3%到91.4%)。
引用
@article{arxiv.2205.08138,
title = {Composing General Audio Representation by Fusing Multilayer Features of a Pre-trained Model},
author = {Daisuke Niizumi and Daiki Takeuchi and Yasunori Ohishi and Noboru Harada and Kunio Kashino},
journal= {arXiv preprint arXiv:2205.08138},
year = {2022}
}
备注
5 pages, 4 figures and 4 tables. Accepted by EUSIPCO 2022