中文

基于神经网络的虚拟麦克风估计器

音频与语音处理 2021-01-13 v1 机器学习 声音

摘要

由于许多设备的限制,开发适用于少量麦克风的话筒阵列技术十分重要。解决该问题的一种思路是虚拟地增加麦克风信号数量,例如基于若干物理模型假设。然而,此类假设在真实条件下未必成立。本文中,作为一种替代方法,我们提出了一种基于神经网络的虚拟麦克风估计器(NN-VME)。NN-VME 利用近期时域神经网络精确的估计能力,直接在时域估计虚拟麦克风信号。我们采用全监督学习框架,在训练时使用虚拟麦克风位置处的实际观测。因此,NN-VME 可仅利用多通道观测进行训练,从而直接在真实录音上训练,避免了对不现实物理模型假设的需求。在 CHiME-4 语料库上的实验表明,所提出的 NN-VME 即使对真实录音也实现了较高的虚拟麦克风估计性能,且由 NN-VME 增强的波束成形器同时改善了语音增强与识别性能。

关键词

引用

@article{arxiv.2101.04315,
  title  = {Neural Network-based Virtual Microphone Estimator},
  author = {Tsubasa Ochiai and Marc Delcroix and Tomohiro Nakatani and Rintaro Ikeshita and Keisuke Kinoshita and Shoko Araki},
  journal= {arXiv preprint arXiv:2101.04315},
  year   = {2021}
}

备注

5 pages, 2 figures, submitted to ICASSP 2021