中文

基于多模态深度卷积神经网络的视听语音增强

声音 2022-04-19 v5 多媒体 音频与语音处理 机器学习

摘要

语音增强(SE)旨在降低语音信号中的噪声。大多数SE技术仅关注音频信息。在本工作中,受利用来自不同模态数据的多模态学习以及卷积神经网络(CNNs)在SE中近期成功的启发,我们提出了一种视听深度CNNs (AVDCNN) SE模型,该模型将音频和视觉流整合到一个统一的网络模型中。我们还提出了一种在输出层重建音频和视觉信号的多任务学习框架。准确地说,所提出的AVDCNN模型被构建为一个视听编码器-解码器网络,其中音频和视觉数据首先使用各自的CNN处理,然后融合到一个联合网络中,以在输出层生成增强语音(主要任务)和重建图像(次要任务)。该模型以端到端方式训练,参数通过反向传播联合学习。我们使用五项客观评价指标对增强语音进行评估。结果表明,与仅基于音频的CNN SE模型以及两种传统SE方法相比,AVDCNN模型表现出显著更优的性能,证实了将视觉信息整合到SE过程中的有效性。此外,AVDCNN模型还优于现有的一种视听SE模型,证实了其在SE中有效结合音频和视觉信息的能力。

关键词

引用

@article{arxiv.1709.00944,
  title  = {Audio-Visual Speech Enhancement Using Multimodal Deep Convolutional Neural Networks},
  author = {Jen-Cheng Hou and Syu-Siang Wang and Ying-Hui Lai and Yu Tsao and Hsiu-Wen Chang and Hsin-Min Wang},
  journal= {arXiv preprint arXiv:1709.00944},
  year   = {2022}
}

备注

This paper is the same as arXiv:1703.10893v6. Apologies for the inconvenience. arXiv admin note: text overlap with arXiv:1703.10893