中文

LipVoicer:基于唇读引导从无声视频生成语音

音频与语音处理 2024-03-29 v2 声音

摘要

唇到语音旨在生成与人物说话的无声视频同步的自然听感语音。尽管近期取得进展,现有方法仍无法针对LRS3等具有挑战性的真实数据集生成高可懂度的高质量语音。本文提出LipVoicer,一种通过引入文本模态来生成高质量语音的新方法,即便对于野外(in-the-wild)且丰富的数据集亦如此。给定无声视频,我们首先使用预训练唇读网络预测所说文本。随后,我们以视频为条件构建扩散模型,并通过分类器引导机制利用提取的文本,其中预训练ASR作为分类器。LipVoicer在LRS2和LRS3上的表现优于多个唇到语音基线,这些为野外数据集,测试集含数百独特说话人且词汇不受限。此外,实验表明文本模态的引入对生成语音的可懂度起主要作用,听感上清晰可辨,并在WER指标的显著降低中得到实证反映。我们通过人工评估证明了LipVoicer的有效性,显示其相较竞争方法生成更自然且同步的语音信号。最后,我们制作了demo展示LipVoicer在生成自然、同步且可懂语音上的优势,提供其有效性的进一步证据。项目页与代码:https://github.com/yochaiye/LipVoicer

关键词

引用

@article{arxiv.2306.03258,
  title  = {LipVoicer: Generating Speech from Silent Videos Guided by Lip Reading},
  author = {Yochai Yemini and Aviv Shamsian and Lior Bracha and Sharon Gannot and Ethan Fetaya},
  journal= {arXiv preprint arXiv:2306.03258},
  year   = {2024}
}

备注

ICLR 2024