中文

面向静止与移动说话人的多通道长期流式神经语音增强

声音 2024-06-21 v2 音频与语音处理

摘要

在本工作中,我们将先前提出的离线 SpatialNet 扩展至静止和移动说话人场景下的长期流式多通道语音增强。SpatialNet 利用空间信息(如语音的空间/导向方向)来区分目标语音与干扰,并取得了出色的性能。SpatialNet 的核心是一个窄带自注意力模块,用于学习空间向量的时间动态特性。为实现长期流式语音增强,我们提出用在线网络替换离线自注意力网络,这些在线网络相对于信号长度具有线性推理复杂度,同时保持学习长期信息的能力。我们基于以下三者开发了三种变体: 掩码自注意力; Retention,一种具有线性推理复杂度的自注意力变体; Mamba,一种基于结构化状态空间的类 RNN 网络。此外,我们研究了不同网络的长度外推能力,即在远长于训练信号的信号上进行测试,并提出了一种“短信号训练加长信号微调”的策略,该策略在有限的训练时间内大幅提升了网络的长度外推能力。总体而言,所提出的在线 SpatialNet 在长音频流以及静止和移动说话人场景下均取得了出色的语音增强性能。所提出的方法已在 https://github.com/Audio-WestlakeU/NBSS 开源。

关键词

引用

@article{arxiv.2403.07675,
  title  = {Multichannel Long-Term Streaming Neural Speech Enhancement for Static and Moving Speakers},
  author = {Changsheng Quan and Xiaofei Li},
  journal= {arXiv preprint arXiv:2403.07675},
  year   = {2024}
}

备注

Accepted by IEEE Signal Processing Letters