中文

NaturalL2S:基于可微分数字信号处理的端到端高质量多说话人唇语到语音合成

声音 2025-02-18 v1 计算机视觉与模式识别 音频与语音处理

摘要

视觉语音识别(VSR)的最新进展推动了唇语到语音合成的发展,其中预训练的 VSR 模型通过提供有价值的语义信息增强了合成语音的可懂度。级联框架的成功——结合伪 VSR 与伪文本到语音(TTS),或隐式利用转录文本——凸显了利用 VSR 模型的好处。然而,这些方法通常依赖梅尔频谱图作为中间表示,这可能引入一个关键瓶颈:从 inherently error-prone 的唇语到语音映射生成的合成梅尔频谱图与用于训练声码器的真实梅尔频谱图之间的领域差距。这种不匹配不可避免地降低了合成质量。为弥合这一差距,我们提出了 Natural Lip-to-Speech (NaturalL2S),一个将声学归纳偏置与可微分语音生成组件相结合的端到端框架。具体而言,我们引入了一个基频(F0)预测器来捕获合成语音中的韵律变化。预测的 F0 随后驱动一个可微分数字信号处理(DDSP)合成器生成粗信号,作为后续语音合成的先验信息。此外,我们的方法在不显式建模说话人特征的情况下,通过使用参考说话人嵌入作为辅助输入,实现了令人满意的说话人相似度表现。客观和主观评估结果表明,与最先进方法相比,NaturalL2S 能有效提升合成语音的质量。我们的演示页面可通过 https://yifan-liang.github.io/NaturalL2S/ 访问。

关键词

引用

@article{arxiv.2502.12002,
  title  = {NaturalL2S: End-to-End High-quality Multispeaker Lip-to-Speech Synthesis with Differential Digital Signal Processing},
  author = {Yifan Liang and Fangkun Liu and Andong Li and Xiaodong Li and Chengshi Zheng},
  journal= {arXiv preprint arXiv:2502.12002},
  year   = {2025}
}