VisualTTS:具有精确唇语同步的TTS用于自动配音
音频与语音处理
2022-03-03 v3 计算与语言
摘要
在本文中,我们提出一项新任务:合成与静音预录视频同步的语音,称为自动配音(AVO)。与传统语音合成不同,AVO力求生成不仅拟人化的语音,而且完美的唇语同步。AVO的一个自然解决方案是使语音渲染以视频中唇部序列的时间推进为条件。我们提出一种以视觉输入为条件的新型文本到语音模型,名为VisualTTS,用于精确的唇语同步。所提VisualTTS采用两种新机制:1)文本-视觉注意力,以及2)声学解码期间的视觉融合策略,二者均有助于在输入文本内容与输入唇部序列中的唇动之间形成精确对齐。实验结果表明,VisualTTS实现了准确的唇语同步,并优于所有基线系统。
引用
@article{arxiv.2110.03342,
title = {VisualTTS: TTS with Accurate Lip-Speech Synchronization for Automatic Voice Over},
author = {Junchen Lu and Berrak Sisman and Rui Liu and Mingyang Zhang and Haizhou Li},
journal= {arXiv preprint arXiv:2110.03342},
year = {2022}
}
备注
To appear at ICASSP 2022