中文

论神经维纳滤波器对于资源高效多通道语音增强的重要性

声音 2024-01-17 v1 音频与语音处理

摘要

我们引入了一个用于高效多通道语音增强的时域框架,强调低延迟和计算效率。该框架包含两个紧凑的深度神经网络(DNN),围绕着一个多通道神经维纳滤波器(NWF)。第一个DNN增强语音信号以估计NWF系数,而第二个DNN则细化NWF的输出。NWF虽然在概念上类似于传统的频域维纳滤波器,但经过了针对低延迟语音增强优化的训练过程,涉及对分析和合成变换的微调。我们的研究结果表明,NWF的输出具有最小的非线性失真,其性能水平可与第一个DNN相媲美,这偏离了传统的维纳滤波器范式。尽管方法简单,但联合训练所有组件优于顺序训练。因此,该框架以更少的参数和更低的计算需求实现了卓越的性能,使其成为资源高效多通道语音增强的一个引人注目的解决方案。

关键词

引用

@article{arxiv.2401.07882,
  title  = {On the Importance of Neural Wiener Filter for Resource Efficient Multichannel Speech Enhancement},
  author = {Tsun-An Hsieh and Jacob Donley and Daniel Wong and Buye Xu and Ashutosh Pandey},
  journal= {arXiv preprint arXiv:2401.07882},
  year   = {2024}
}

备注

Accepted for publication at ICASSP