中文

用于语音增强、声源定位与语音活动检测的多通道端到端神经网络

音频与语音处理 2022-06-22 v1

摘要

语音增强与声源定位作为具有广泛实际应用的研究方向已活跃数十年。近来,深度复数卷积循环网络(DCCRN)在单通道系统中取得了令人印象深刻的增强性能。在本研究中,提出了一种由波束成形器与新多通道DCCRN组成的神经波束成形器,用于语音增强与声源定位。由多通道DCCRN估计的复值滤波器作为波束成形器的权重。此外,采用一种基于单阶段学习的过程进行语音增强与声源定位。所提出的由多通道DCCRN与辅助网络组成的网络对声场建模,同时最小化无失真响应损失函数。仿真结果表明,所提出的神经波束成形器能有效增强语音信号,且良好保持语音质量。该神经波束成形器还提供声源定位与语音活动检测(VAD)功能。

关键词

引用

@article{arxiv.2206.09728,
  title  = {Multi-channel end-to-end neural network for speech enhancement, source localization, and voice activity detection},
  author = {Yuan Chen and Yicheng Hsu and Mingsian R. Bai},
  journal= {arXiv preprint arXiv:2206.09728},
  year   = {2022}
}

备注

Accepted by ICA2022