音视觉语音编解码器:以重合成重新审视音视觉语音增强
计算机视觉与模式识别
2022-04-01 v1 机器学习
音频与语音处理
摘要
由于诸如唇部运动等面部动作包含关于语音内容的重要信息,音视觉语音增强方法比仅音频的方法更准确并不令人意外。然而,最先进的方案在具有挑战性的声学环境中仍难以生成无噪声伪影与自然畸变的干净、逼真语音。在本文中,我们提出一种用于 AR/VR 中高保真通信的新型音视觉语音增强框架。我们的方法利用音视觉语音线索生成神经语音编解码器的码本,从而能从带噪信号高效合成干净、逼真的语音。鉴于说话人特定线索在语音中的重要性,我们专注于开发对个体说话人效果良好的个性化模型。我们在一个于无约束、大词汇量环境下采集的新音视觉语音数据集以及现有音视觉数据集上展示了方法的有效性,在量化指标与人类评估研究上均优于语音增强基线。定性结果请见补充视频:https://github.com/facebookresearch/facestar/releases/download/paper_materials/video.mp4。
引用
@article{arxiv.2203.17263,
title = {Audio-Visual Speech Codecs: Rethinking Audio-Visual Speech Enhancement by Re-Synthesis},
author = {Karren Yang and Dejan Markovic and Steven Krenn and Vasu Agrawal and Alexander Richard},
journal= {arXiv preprint arXiv:2203.17263},
year = {2022}
}