中文

面向野外场景的精准唇语到语音合成

多媒体 2024-03-05 v1 计算机视觉与模式识别 声音 音频与语音处理

摘要

本文提出了一种新颖方法,旨在仅基于唇部动作,从任意野外说话人的无声视频中合成语音。直接从唇部视频生成语音的传统方法面临无法仅从语音中学习鲁棒语言模型的挑战,导致结果不尽如人意。为克服这一问题,我们提议利用最先进的唇语到文本网络引入噪声文本监督,从而将语言信息注入我们的模型。噪声文本由预训练的唇语到文本模型生成,使我们的方法能够在推理阶段无需文本标注。我们设计了一个视觉文本到语音网络,利用视觉流生成与无声输入视频同步的精准语音。我们进行了广泛的实验和消融研究,证明了我们的方法在各种基准数据集上优于当前的最先进方法。此外,我们通过为一位失去声音但能进行口部运动的肌萎缩侧索硬化症(ALS)患者生成语音,展示了该方法在辅助技术中的重要实际应用。我们的演示视频、代码及更多详情可见于\url{http://cvit.iiit.ac.in/research/projects/cvit-projects/ms-l2s-itw}。

关键词

引用

@article{arxiv.2403.01087,
  title  = {Towards Accurate Lip-to-Speech Synthesis in-the-Wild},
  author = {Sindhu Hegde and Rudrabha Mukhopadhyay and C. V. Jawahar and Vinay Namboodiri},
  journal= {arXiv preprint arXiv:2403.01087},
  year   = {2024}
}

备注

8 pages of content, 1 page of references and 4 figures