场景无关的多麦克风语音去混响
音频与语音处理
2021-06-14 v2 机器学习
声音
摘要
神经网络(NNs)已广泛应用于语音处理任务,特别是采用麦克风阵列的那些任务。然而,大多数现有NN架构只能处理固定且位置特定的麦克风阵列。在本文中,我们提出一种NN架构,可应对麦克风数量和位置均未知的麦克风阵列,并展示其在语音去混响任务中的适用性。为此,我们的方法利用深度学习在集合结构数据上的近期进展来设计一种增强混响对数谱的架构。我们使用模拟混响数据集的带噪和无噪版本来测试所提架构。在带噪数据上的实验表明,所提场景无关设置优于一个强大的场景感知框架,有时甚至使用更少的麦克风。在无噪数据集上,我们表明在大多数情况下,我们的方法优于位置感知网络以及最先进的加权线性预测误差(WPE)算法。
引用
@article{arxiv.2010.11875,
title = {Scene-Agnostic Multi-Microphone Speech Dereverberation},
author = {Yochai Yemini and Ethan Fetaya and Haggai Maron and Sharon Gannot},
journal= {arXiv preprint arXiv:2010.11875},
year = {2021}
}