中文

真实嘈杂对话环境下基于增强现实头显的方向感知自适应在线神经语音增强

音频与语音处理 2022-07-18 v1 机器学习 声音

摘要

本文描述了一种面向增强现实(AR)头显的在线语音增强的实用响应与性能感知开发,该头显可帮助用户在真实嘈杂混响环境(如鸡尾酒会)中理解对话。人们可以使用一种称为快速多通道非负矩阵分解(FastMNMF)的最先进盲源分离方法,该方法因其无监督特性而在多种环境中表现良好。然而,其高昂的计算成本阻碍了其应用于实时处理。相比之下,使用深度神经网络(DNN)估计语音与噪声空间信息的监督波束成形方法易于适配实时处理,但在失配条件下会出现严重的性能下降。鉴于这种互补特性,我们提出了一种基于DNN波束成形并结合FastMNMF引导自适应的双过程鲁棒在线语音增强方法。FastMNMF(后端)以迷你批处理方式执行,将带噪语音与增强语音对连同原始并行训练数据一起,在计算允许的间隔内通过反向传播更新方向感知DNN(前端)。该方法与一种称为加权预测误差(WPE)的盲去混响方法结合使用,以流式方式转录说话人的嘈杂混响语音(该说话人可通过视频检测或由用户手势或眼动选择),并利用AR技术以空间方式显示转录文本。我们的实验表明,仅使用十二分钟观测进行运行时自适应,词错误率便改善了超过10个百分点。

关键词

引用

@article{arxiv.2207.07296,
  title  = {Direction-Aware Adaptive Online Neural Speech Enhancement with an Augmented Reality Headset in Real Noisy Conversational Environments},
  author = {Kouhei Sekiguchi and Aditya Arie Nugraha and Yicheng Du and Yoshiaki Bando and Mathieu Fontaine and Kazuyoshi Yoshii},
  journal= {arXiv preprint arXiv:2207.07296},
  year   = {2022}
}

备注

IEEE/RSJ IROS 2022