面向语音基础模型的输入条件化层丢弃
声音
2025-07-11 v1 计算机视觉与模式识别
音频与语音处理
摘要
为边缘和 IoT 场景精选语音基础模型需要动态体系结构,其中计算资源随时间变化,需要可调的减法策略。一种新兴方法是层丢弃 (),在推理期间跳过背板网络的部分层以降低计算负载。这使得静态模型转换为动态模型。然而,现有方法在层选择方式或显著修改神经网络体系结构方面存在局限。为此,我们提出一种以输入驱动的 ,采用网络的输入特征和轻量级层选择网络来确定最佳处理层组合。在 4 个语音和音频公共基准测试上进行大量实验,使用两种不同的预训练基础模型,证明了我们方法的有效性,显著优于随机丢弃,并与早期退出相当或更好。
引用
@article{arxiv.2507.07954,
title = {Input Conditioned Layer Dropping in Speech Foundation Models},
author = {Abdul Hannan and Daniele Falavigna and Alessio Brutti},
journal= {arXiv preprint arXiv:2507.07954},
year = {2025}
}
备注
Accepted at IEEE MLSP 2025