中文

超越文字:面向文本到语音的自然场景视觉驱动韵律

计算机视觉与模式识别 2022-03-25 v2 计算与语言

摘要

在本文中,我们提出了 VDTTS,一种视觉驱动文本到语音模型。受配音启发,VDTTS 利用视频帧作为文本之外的附加输入,并生成与视频信号匹配的语音。我们展示了这如何使 VDTTS 不同于普通 TTS 模型,不仅能够生成具有自然停顿和音高等韵律变化的语音,还能与输入视频同步。在实验中,我们表明在包括来自 VoxCeleb2 的“自然场景”内容在内的多个具有挑战性的基准测试中,我们的模型产生了良好同步的输出,接近真实值的视频-语音同步质量。在项目页面上展示了展示视频-语音同步、对说话人 ID 替换的鲁棒性以及韵律的补充演示视频。

关键词

引用

@article{arxiv.2111.10139,
  title  = {More than Words: In-the-Wild Visually-Driven Prosody for Text-to-Speech},
  author = {Michael Hassid and Michelle Tadmor Ramanovich and Brendan Shillingford and Miaosen Wang and Ye Jia and Tal Remez},
  journal= {arXiv preprint arXiv:2111.10139},
  year   = {2022}
}