基于神经网络的虚拟麦克风估计及其虚拟麦克风级与波束形成器级多任务损失
音频与语音处理
2023-11-21 v1
摘要
阵列处理性能取决于可用麦克风的数量。虚拟麦克风估计(VME)被提出以人工增加麦克风信号数量。基于神经网络的 VME(NN-VME)以 VM 级损失训练 NN,预测在训练时可用但推理时不可用的麦克风位置处的信号。然而,该训练目标对特定阵列处理后端(如波束形成)可能并非最优。另一种方法是使用考虑阵列处理后端的训练目标,例如波束形成器输出上的损失。该方法可生成对波束形成最优但未必具物理依据的信号。为结合两种方法的优势,本文提出一种结合 VM 级与波束形成器级损失的 NN-VME 多任务损失。我们在多说话人欠定条件下评估所提多任务 NN-VME,结果表明相比仅用真实麦克风实现了 33.1% 的相对 WER 提升,相比先前 NN-VME 方法提升 10.8%。
引用
@article{arxiv.2311.11595,
title = {Neural network-based virtual microphone estimation with virtual microphone and beamformer-level multi-task loss},
author = {Hanako Segawa and Tsubasa Ochiai and Marc Delcroix and Tomohiro Nakatani and Rintaro Ikeshita and Shoko Araki and Takeshi Yamada and Shoji Makino},
journal= {arXiv preprint arXiv:2311.11595},
year = {2023}
}
备注
5 pages, 2 figures, 1 table