自适应修剪用于可扩展且高效的语音增强
音频与语音处理
2025-12-02 v1 机器学习
声音
摘要
语音增强(SE)使语音识别、实时通信、听力辅助器具等应用能够实现稳健的语音质量。然而,在资源受限的设备上部署此类系统涉及在性能和计算效率之间选择静态权衡。本文引入动态修剪技术,用于DEMUCs(一种流行的SE架构),使其具备可扩展性和输入自适应性。通过修剪,模型可在不同的利用率因子(UF)下运行,每个因子对应于不同的性能/效率权衡,实际上无需额外存储成本即可模拟多个模型大小。此外,一个路由子网以端到端方式与主干网络一起训练,用于确定当前输入的最优UF。因此,系统可在额外复杂度不必要时自适应选择较小的UF,从而节省资源。我们证明了该解决方案在Pareto最优性检验中优于单个UF,确认了动态路由的优势。当训练所提出的动态可修剪模型时,平均使用10%的容量,可获得与等效静态25%利用率相同或更好的语音质量,同时将MACs减少29%。
引用
@article{arxiv.2507.04879,
title = {Adaptive Slimming for Scalable and Efficient Speech Enhancement},
author = {Riccardo Miccini and Minje Kim and Clément Laroche and Luca Pezzarossa and Paris Smaragdis},
journal= {arXiv preprint arXiv:2507.04879},
year = {2025}
}
备注
Accepted for publication at the 2025 IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (WASPAA 2025)