中文

无真实视觉流下的视觉语音增强

计算机视觉与模式识别 2020-12-22 v1 机器学习 多媒体 声音 音频与语音处理

摘要

在这项工作中,我们重新思考了在非受限真实世界环境中的语音增强任务。当前最先进的方法仅使用音频流,在广泛的真实世界噪声中性能受限。近期利用唇部运动作为额外线索的工作相比“仅音频”方法提升了生成语音的质量。但是,这些方法的视觉流不可靠或完全缺失,无法用于若干应用。我们提出了一种利用近期语音驱动唇形合成突破的语音增强新范式。使用这样一个模型作为教师网络,我们训练一个鲁棒的学生网络来生成准确的唇部运动以掩蔽噪声,从而充当“视觉噪声滤波器”。我们的伪唇方法增强的语音可懂度与使用真实嘴唇的情况相当(差异 < 3%)。这意味着即使在缺乏真实视频流时,我们也能利用唇部运动的优势。我们使用定量指标和人工评估严格评价了我们的模型。额外的消融研究和网站上的包含定性比较与结果的演示视频清楚地说明了我们方法的有效性。我们提供了一个演示视频,在我们的网站上清晰地说明了所提方法的有效性:\url{http://cvit.iiit.ac.in/research/projects/cvit-projects/visual-speech-enhancement-without-a-real-visual-stream}。代码和模型也已发布以供未来研究:\url{https://github.com/Sindhu-Hegde/pseudo-visual-speech-denoising}。

关键词

引用

@article{arxiv.2012.10852,
  title  = {Visual Speech Enhancement Without A Real Visual Stream},
  author = {Sindhu B Hegde and K R Prajwal and Rudrabha Mukhopadhyay and Vinay Namboodiri and C. V. Jawahar},
  journal= {arXiv preprint arXiv:2012.10852},
  year   = {2020}
}

备注

10 pages, 4 figures, Accepted in WACV 2021