中文

使用多模态深度卷积神经网络的视听语音增强

声音 2018-01-25 v6 多媒体 机器学习

摘要

语音增强(SE)旨在降低语音信号中的噪声。大多数 SE 技术仅关注处理音频信息。在本工作中,受利用不同模态数据的多模态学习以及卷积神经网络(CNN)在 SE 中近期成功的启发,我们提出了一种视听深度 CNN(AVDCNN)SE 模型,该模型将音频和视觉流整合到一个统一的网络模型中。我们还提出了一个多任务学习框架,用于在输出层重建音频和视觉信号。具体而言,所提出的 AVDCNN 模型被构建为一个视听编码器-解码器网络,其中音频和视觉数据首先使用各自的 CNN 进行处理,然后融合到一个联合网络中,在输出层生成增强的语音(主任务)和重建的图像(次任务)。该模型以端到端的方式进行训练,参数通过反向传播联合学习。我们使用五项客观指标评估了增强后的语音。结果表明,与基于纯音频 CNN 的 SE 模型和两种传统 SE 方法相比,AVDCNN 模型产生了显著优越的性能,证实了将视觉信息整合到 SE 过程中的有效性。此外,AVDCNN 模型也优于现有的视听 SE 模型,证实了其在 SE 中有效结合音频和视觉信息的能力。

关键词

引用

@article{arxiv.1703.10893,
  title  = {Audio-Visual Speech Enhancement Using Multimodal Deep Convolutional Neural Networks},
  author = {Jen-Cheng Hou and Syu-Siang Wang and Ying-Hui Lai and Yu Tsao and Hsiu-Wen Chang and Hsin-Min Wang},
  journal= {arXiv preprint arXiv:1703.10893},
  year   = {2018}
}

备注

To appear in IEEE Transactions on Emerging Topics in Computational Intelligence. Some audio samples can be reached in this link: https://sites.google.com/view/avse2017