中文

迈向鲁棒的实时视听语音增强

声音 2021-12-17 v1 计算机视觉与模式识别 机器学习 音频与语音处理

摘要

人类大脑根据情境利用异构感官信息来高效执行包括视觉和听觉在内的认知任务。例如,在鸡尾酒会场景下,人类听觉皮层根据情境整合视听 (AV) 线索以更好地感知语音。最近的研究表明,与纯音频 SE 模型相比,AV 语音增强 (SE) 模型可以在极低信噪比 (SNR) 环境下显著提高语音质量和可懂度。然而,尽管在 AV SE 领域进行了大量研究,但开发低延迟的实时处理模型仍然是一个艰巨的技术挑战。在本文中,我们提出了一种用于低延迟、非特定说话人 AV SE 的新颖框架,该框架可以泛化到一系列视觉和声学噪声。具体而言,提出了一种生成对抗网络 (GAN) 来解决 AV SE 中视觉缺陷的实际问题。此外,我们提出了一种基于深度神经网络的实时 AV SE 模型,该模型考虑了来自 GAN 的清晰视觉语音输出,以提供更鲁棒的 SE。所提出的框架使用客观语音质量和可懂度指标以及主观听力测试在合成和真实噪声 AV 语料库上进行了评估。对比仿真结果表明,我们的实时 AV SE 框架优于 SOTA SE 方法,包括最近基于 DNN 的 SE 模型。

关键词

引用

@article{arxiv.2112.09060,
  title  = {Towards Robust Real-time Audio-Visual Speech Enhancement},
  author = {Mandar Gogate and Kia Dashtipour and Amir Hussain},
  journal= {arXiv preprint arXiv:2112.09060},
  year   = {2021}
}