中文

深度自组织波束成形

声音 2021-02-10 v7 音频与语音处理

摘要

远场语音处理是一个重要且具有挑战性的问题。本文中,我们提出深度自组织波束成形(deep ad-hoc beamforming),一种基于深度学习的多通道语音增强框架,基于自组织麦克风阵列来解决该问题。它包含三个新颖组件。首先,它将自组织麦克风阵列(ad-hoc microphone arrays)与基于深度学习的多通道语音增强相结合,显著降低了远场声学环境出现的概率。其次,它通过基于深度神经网络的监督信道选择框架,将语音源周围的麦克风分组为局部麦克风阵列。第三,它开发了一个简单的时间同步框架,以同步具有不同时延的信道。除上述新颖性和优势外,所提模型还以单通道方式进行训练,从而可轻松采用语音处理技术的新进展。其测试阶段也可灵活接入任意数量的麦克风而无需重新训练或修改框架。我们开发了所提框架的多种实现,并在语音源位置为远场、随机且对麦克风盲知的场景下进行了广泛实验。语音增强任务的结果表明,在扩散噪声混响环境和点源噪声混响环境中,我们的方法均大幅优于使用线性麦克风阵列的对应方法。我们还用不同手工特征测试了该框架。结果表明,尽管设计良好特征可带来高性能,但它们不影响所提框架有效性的结论。

关键词

引用

@article{arxiv.1811.01233,
  title  = {Deep Ad-hoc Beamforming},
  author = {Xiao-Lei Zhang},
  journal= {arXiv preprint arXiv:1811.01233},
  year   = {2021}
}

备注

Accepted by Computer Speech and Language