论实时多阶段语音增强系统
音频与语音处理
2023-12-20 v1
摘要
最近,多阶段系统在基于深度学习的语音增强方法中脱颖而出。然而,这些系统的复杂度总是很高,需要数百万个参数和强大的计算资源,这限制了它们在低功耗设备上用于实时处理的应用。此外,各种影响因素对多阶段系统成功的贡献仍不清楚,这给减小这些系统的规模带来了挑战。在本文中,我们广泛研究了一个仅具有 560k 总参数的轻量级两阶段网络。它由第一阶段的 Mel 尺度幅度掩蔽模型和第二阶段的复谱映射模型组成。我们首先综合论述了增益功率因子、后滤波器和训练标签对 Mel 尺度掩蔽模型的作用。然后,我们探索了两阶段网络的几种训练方案,并对两阶段网络的优越性提供了一些见解。我们表明,通过最优方案训练的所提出的两阶段网络实现了与四倍大的开源模型 DeepFilterNet2 相似的性能。
引用
@article{arxiv.2312.12415,
title = {On real-time multi-stage speech enhancement systems},
author = {Lingjun Meng and Jozef Coldenhoff and Paul Kendrick and Tijana Stojkovic and Andrew Harper and Kiril Ratmanski and Milos Cernak},
journal= {arXiv preprint arXiv:2312.12415},
year = {2023}
}
备注
To appear at ICASSP 2024