中文

无训练适配的预训练模型用于环境声音分类

声音 2024-12-24 v1 音频与语音处理

摘要

基于深度神经网络(DNN)的环境声音分类模型面临训练数据所属域的鲁棐性问题,即离散分布(OOOD)或未见数据。为利用预训练模型处理未知域,通常需要采用微调和迁移学习等适应方法,要求丰富的计算资源,如图形处理单元(GPU)。然而,随着最先进模型计算资源需求的增加,缺乏计算资源的研究者越来越难跟上研究动态。在本文中,我们提出了一种针对预训练模型进行无训练适配的方法。为引入无训练适配方法,首先我们提出了恢复DNN中间层中时频( TF-ish)结构的操作。随后,我们提出了一种基于无训练频率过滤的方法进行域适应,该方法不依赖于广泛使用的梯度优化。使用ESC-50数据集进行的实验表明,所提出的适应方法相较于传统方法可提高20.40个百分点的分类准确率。

关键词

引用

@article{arxiv.2412.17212,
  title  = {Trainingless Adaptation of Pretrained Models for Environmental Sound Classification},
  author = {Noriyuki Tonami and Wataru Kohno and Keisuke Imoto and Yoshiyuki Yajima and Sakiko Mishima and Reishi Kondo and Tomoyuki Hino},
  journal= {arXiv preprint arXiv:2412.17212},
  year   = {2024}
}

备注

Accepted to ICASSP2025