中文

实时视听端到端语音增强

音频与语音处理 2023-03-14 v1

摘要

视听语音增强(AV-SE)方法利用辅助视觉线索来增强说话人声音。因此,从技术上讲,它们应能够优于仅音频的语音增强(SE)方法。然而,文献中鲜有可在 CPU 上实时运行的 AV-SE 系统相关工作。本文中,我们提出一种基于近期提出的端到端增强网络(E3Net)的低延迟实时视听端到端增强(AV-E3Net)模型。我们的主要贡献包括两方面:1)我们采用密集连接模块来解决深层模型结构引起的性能退化,该模块显著提升了模型在 AV-SE 任务上的性能。2)我们提出多阶段门控与求和(GS)融合模块以合并音频与视觉线索。我们的结果表明,所提模型以可忽略的计算成本增加提供了优于基线 E3net 模型的感知质量与可懂度。

关键词

引用

@article{arxiv.2303.07005,
  title  = {Real-Time Audio-Visual End-to-End Speech Enhancement},
  author = {Zirun Zhu and Hemin Yang and Min Tang and Ziyi Yang and Sefik Emre Eskimez and Huaming Wang},
  journal= {arXiv preprint arXiv:2303.07005},
  year   = {2023}
}

备注

Accepted by ICASSP 2023