中文

关联子词发音与唇形以实现嵌入感知的音视频语音增强

声音 2020-09-22 v1 机器学习 音频与语音处理

摘要

本文提出一种视觉嵌入方法,通过在音素和发音部位层面同步视觉唇帧,来改进嵌入感知语音增强(EASE)。我们首先使用预训练的音素或发音部位识别器从唇帧中提取视觉嵌入,用于纯视觉EASE(VEASE)。接下来,我们以信息交集方式从带噪语音和唇视频中提取音视频嵌入,利用音频与视觉特征的互补性实现多模态EASE(MEASE)。在受模拟加性噪声污染的TCD-TIMIT语料库上的实验表明,我们提出的基于子词的VEASE方法比传统的词级嵌入更有效。此外,在发音部位层面的视觉嵌入利用了发音部位与唇形之间的高相关性,表现出比音素层面更好的性能。最后,所提出的MEASE框架结合了音频与视觉嵌入,比最佳的纯视觉和纯音频EASE系统显著获得更好的语音质量与可懂度。

关键词

引用

@article{arxiv.2009.09561,
  title  = {Correlating Subword Articulation with Lip Shapes for Embedding Aware Audio-Visual Speech Enhancement},
  author = {Hang Chen and Jun Du and Yu Hu and Li-Rong Dai and Bao-Cai Yin and Chin-Hui Lee},
  journal= {arXiv preprint arXiv:2009.09561},
  year   = {2020}
}

备注

34 pages, 8 figures