超越文字:面向文本到语音的自然场景视觉驱动韵律
计算机视觉与模式识别
2022-03-25 v2 计算与语言
摘要
在本文中,我们提出了 VDTTS,一种视觉驱动文本到语音模型。受配音启发,VDTTS 利用视频帧作为文本之外的附加输入,并生成与视频信号匹配的语音。我们展示了这如何使 VDTTS 不同于普通 TTS 模型,不仅能够生成具有自然停顿和音高等韵律变化的语音,还能与输入视频同步。在实验中,我们表明在包括来自 VoxCeleb2 的“自然场景”内容在内的多个具有挑战性的基准测试中,我们的模型产生了良好同步的输出,接近真实值的视频-语音同步质量。在项目页面上展示了展示视频-语音同步、对说话人 ID 替换的鲁棒性以及韵律的补充演示视频。
引用
@article{arxiv.2111.10139,
title = {More than Words: In-the-Wild Visually-Driven Prosody for Text-to-Speech},
author = {Michael Hassid and Michelle Tadmor Ramanovich and Brendan Shillingford and Miaosen Wang and Ye Jia and Tal Remez},
journal= {arXiv preprint arXiv:2111.10139},
year = {2022}
}