中文

保留所需内容:从大型音频表示模型中提取高效子网络

声音 2025-02-19 v1 人工智能

摘要

最近,音频基模型研究取得了显著进展,如此在复杂的下游任务上取得不断提升的结果。随后,这些预训练网络迅速用于各种音频应用。然而,这些改进导致模型的规模和复杂度显著增加。这一问题引发了环境关注,还会阻止这些网络在消费级设备上部署,并使其无法用于实时应用。此外,这似乎与这些模型所使用的任务的特殊性相矛盾——这些任务往往比从任何类型音频数据中提取丰富、通用的表示要简单得多。本文通过一种简单而有效的方法来解决此问题,从大型基模型中提取轻量化的专家子网络。具体而言,我们在预训练表示模型的层之间引入可学习的二元掩码。当在下游任务上进行端到端训练时,我们添加稀疏诱导损失到整体目标中,从而学习针对单个任务的紧凑子网络。重要的是,基模型的权重保持冻结,导致额外的训练成本低。训练完成后,掩码后的计算单元可从网络中移除,从而实现显著的性能提升。我们在三个广泛使用的音频基模型上进行评估,每个模型都基于不同的 backbone 架构,并在常见的音频表示评估任务上展示其有效性,同时在语音、音乐和通用音频方面表现出其多样性。代码用于复现结果及支持网页均 available at https://github.com/gnvIRCAM/Audio-representation-trimming。

关键词

引用

@article{arxiv.2502.12925,
  title  = {Keep what you need : extracting efficient subnetworks from large audio representation models},
  author = {David Genova and Philippe Esling and Tom Hurlin},
  journal= {arXiv preprint arXiv:2502.12925},
  year   = {2025}
}