中文

使用图神经网络的多通道语音增强

声音 2021-02-16 v1 音频与语音处理

摘要

多通道语音增强旨在利用多个麦克风捕获的信号从含噪混合中提取干净语音。近期提出的方法通过将深度神经网络模型与最小方差无失真响应(MVDR)波束形成器等空间滤波技术结合来解决此问题。在本文中,我们引入一种不同的研究方向,将每个音频通道视为位于非欧氏空间(具体为图)中的节点。该表述使我们能够应用图神经网络(GNN)来发现不同通道(节点)间的空间相关性。我们利用图卷积网络(GCN),将其嵌入于 U-Net 架构的嵌入空间中。我们使用 LibriSpeech 数据集并模拟房间声学数据,用不同阵列类型和麦克风数量对我们的方法进行了广泛实验。结果表明与先前最先进方法相比我们方法的优越性。

关键词

引用

@article{arxiv.2102.06934,
  title  = {Multi-Channel Speech Enhancement using Graph Neural Networks},
  author = {Panagiotis Tzirakis and Anurag Kumar and Jacob Donley},
  journal= {arXiv preprint arXiv:2102.06934},
  year   = {2021}
}