中文

面向语音基础模型的输入条件化层丢弃

声音 2025-07-11 v1 计算机视觉与模式识别 音频与语音处理

摘要

为边缘和 IoT 场景精选语音基础模型需要动态体系结构,其中计算资源随时间变化,需要可调的减法策略。一种新兴方法是层丢弃 (LD\mathcal{LD}),在推理期间跳过背板网络的部分层以降低计算负载。这使得静态模型转换为动态模型。然而,现有方法在层选择方式或显著修改神经网络体系结构方面存在局限。为此,我们提出一种以输入驱动的 LD\mathcal{LD},采用网络的输入特征和轻量级层选择网络来确定最佳处理层组合。在 4 个语音和音频公共基准测试上进行大量实验,使用两种不同的预训练基础模型,证明了我们方法的有效性,显著优于随机丢弃,并与早期退出相当或更好。

关键词

引用

@article{arxiv.2507.07954,
  title  = {Input Conditioned Layer Dropping in Speech Foundation Models},
  author = {Abdul Hannan and Daniele Falavigna and Alessio Brutti},
  journal= {arXiv preprint arXiv:2507.07954},
  year   = {2025}
}

备注

Accepted at IEEE MLSP 2025