VisageSynTalk:基于语音-面容特征选择的未见说话人视频到语音合成
计算机视觉与模式识别
2022-07-21 v2 机器学习
声音
音频与语音处理
摘要
本工作的目标是从无声说话人脸视频中重建语音。近期研究在从无声说话人脸视频合成语音方面已展现出令人印象深刻的性能。然而,它们并未显式考虑不同说话人变化的身份特征,这给视频到语音合成带来了挑战,并且在未见说话人设定下变得更为关键。我们的方法是从给定的无声说话人脸视频中分离语音内容与面容风格。通过引导模型独立聚焦于对这两种表示的建模,即使输入视频来自未见受试者,我们也能从模型获得高可懂度的语音。为此,我们引入了语音-面容选择,从输入视频的视觉特征中分离语音内容与说话人身份。解耦后的表示通过基于面容风格的合成器联合融入以合成语音,该合成器在保持语音内容的同时覆盖面容风格来生成语音。因此,所提出的框架带来了即使使用未见受试者的无声说话人脸视频也能合成包含正确内容语音的优势。我们在 GRID、TCD-TIMIT volunteer 和 LRW 数据集上验证了所提框架的有效性。
引用
@article{arxiv.2206.07458,
title = {VisageSynTalk: Unseen Speaker Video-to-Speech Synthesis via Speech-Visage Feature Selection},
author = {Joanna Hong and Minsu Kim and Yong Man Ro},
journal= {arXiv preprint arXiv:2206.07458},
year = {2022}
}
备注
Accepted by ECCV 2022