论神经维纳滤波器对于资源高效多通道语音增强的重要性
声音
2024-01-17 v1 音频与语音处理
摘要
我们引入了一个用于高效多通道语音增强的时域框架,强调低延迟和计算效率。该框架包含两个紧凑的深度神经网络(DNN),围绕着一个多通道神经维纳滤波器(NWF)。第一个DNN增强语音信号以估计NWF系数,而第二个DNN则细化NWF的输出。NWF虽然在概念上类似于传统的频域维纳滤波器,但经过了针对低延迟语音增强优化的训练过程,涉及对分析和合成变换的微调。我们的研究结果表明,NWF的输出具有最小的非线性失真,其性能水平可与第一个DNN相媲美,这偏离了传统的维纳滤波器范式。尽管方法简单,但联合训练所有组件优于顺序训练。因此,该框架以更少的参数和更低的计算需求实现了卓越的性能,使其成为资源高效多通道语音增强的一个引人注目的解决方案。
引用
@article{arxiv.2401.07882,
title = {On the Importance of Neural Wiener Filter for Resource Efficient Multichannel Speech Enhancement},
author = {Tsun-An Hsieh and Jacob Donley and Daniel Wong and Buye Xu and Ashutosh Pandey},
journal= {arXiv preprint arXiv:2401.07882},
year = {2024}
}
备注
Accepted for publication at ICASSP