中文

SyncVoice:基于视觉增强的预训练语音合成视频配音

音频与语音处理 2025-12-08 v1 人工智能 计算与语言 计算机视觉与模式识别 多媒体 声音

摘要

视频配音旨在生成与视觉内容精确同步的高保真语音。现有方法在语音自然性和音视频同步方面仍存在局限,且仅限于单语言场景。为此,我们提出了 SyncVoice,一个基于预训练语音合成(TTS)模型的视觉增强视频配音框架。通过在音视频数据上微调 TTS 模型,我们实现了强大的音视频一致性。我们提出了双说话人编码器(Dual Speaker Encoder),有效缓解跨语言语音合成中的语言干扰,并探讨了视频配音在视频翻译场景中的应用。实验结果表明,SyncVoice 能够实现高保真的语音生成,表现出强大的同步性能,展示了其在视频配音任务中的潜力。

关键词

引用

@article{arxiv.2512.05126,
  title  = {SyncVoice: Towards Video Dubbing with Vision-Augmented Pretrained TTS Model},
  author = {Kaidi Wang and Yi He and Wenhao Guan and Weijie Wu and Hongwu Ding and Xiong Zhang and Di Wu and Meng Meng and Jian Luan and Lin Li and Qingyang Hong},
  journal= {arXiv preprint arXiv:2512.05126},
  year   = {2025}
}