中文

DiffV2S:基于扩散的视频到语音合成与视觉引导说话人嵌入

声音 2023-08-16 v1 计算机视觉与模式识别 机器学习 音频与语音处理

摘要

近期研究在视频到语音合成(仅从视觉输入重建语音)方面取得了令人印象深刻的成果。然而,先前的工作由于缺乏对模型推断正确内容及其恰当声音的充足引导,难以准确合成语音。为解决该问题,它们采用了额外的说话人嵌入作为来自参考听觉信息的说话风格引导。然而,并非总能从对应视频输入中获取音频信息,尤其在推理阶段。本文中,我们提出一种新颖的视觉引导说话人嵌入提取器,使用自监督预训练模型与提示微调(prompt tuning)技术。如此,丰富的说话人嵌入信息可仅由输入视觉信息生成,且推理阶段无需额外音频信息。利用提取的视觉引导说话人嵌入表示,我们进一步开发了基于扩散的视频到语音合成模型,称为 DiffV2S,以这些说话人嵌入与从输入视频提取的视觉表示为条件。所提 DiffV2S 不仅保留了输入视频帧中包含的音素细节,还生成了高度可懂的梅尔频谱图,其中多位说话人的说话人身份均得以保持。实验结果表明,与先前视频到语音合成技术相比,DiffV2S 达到了最先进(SOTA)性能。

关键词

引用

@article{arxiv.2308.07787,
  title  = {DiffV2S: Diffusion-based Video-to-Speech Synthesis with Vision-guided Speaker Embedding},
  author = {Jeongsoo Choi and Joanna Hong and Yong Man Ro},
  journal= {arXiv preprint arXiv:2308.07787},
  year   = {2023}
}

备注

ICCV 2023