中文

用于视听语音增强的带 Conformer 的深度复数 U-Net

音频与语音处理 2023-10-10 v2 声音

摘要

近期研究日益认可将视觉数据纳入语音增强(SE)系统的优势。本文提出一种新颖的视听 SE 方法,称为 DCUC-Net(带 conformer 网络的深度复数 U-Net)。所提 DCUC-Net 利用复数域特征与一堆 conformer 块。DCUC-Net 的编码器与解码器采用基于复数 U-Net 的框架设计。音频与视觉信号分别使用复数编码器与 ResNet-18 模型处理。这些处理后的信号随后通过 conformer 块融合,并经由复数解码器转换为增强语音波形。conformer 块由自注意力机制与卷积操作组合构成,使 DCUC-Net 能有效捕获全局与局部视听依赖。我们的实验结果表明了 DCUC-Net 的有效性,其在 PESQ 上以 0.14 的显著优势优于 COG-MHEAR AVSE Challenge 2023 的基线模型。此外,所提 DCUC-Net 性能与最先进模型相当,并在 Taiwan Mandarin speech with video (TMSV) 数据集上优于所有其他对比模型。

关键词

引用

@article{arxiv.2309.11059,
  title  = {Deep Complex U-Net with Conformer for Audio-Visual Speech Enhancement},
  author = {Shafique Ahmed and Chia-Wei Chen and Wenze Ren and Chin-Jou Li and Ernie Chu and Jun-Cheng Chen and Amir Hussain and Hsin-Min Wang and Yu Tsao and Jen-Cheng Hou},
  journal= {arXiv preprint arXiv:2309.11059},
  year   = {2023}
}