SLD-L2S:面向高保真唇语合成的层次化子空间潜在扩散
音频与语音处理
2026-02-13 v1 计算工程、金融与科学
摘要
尽管唇语合成(L2S)在最近几年取得了显著进展,但当前的状态方法通常依赖于中间表示,如梅尔频谱或离散自监督学习(SSL)标记。潜在扩散模型(LDMs)在该任务中的潜力仍基本未被探索。本文引入 SLD-L2S,一个基于层次化子空间潜在扩散模型的新型 L2S 框架。我们的方法旨在直接将视觉唇部动作映射到预训练神经音频编解码器的连续潜在空间,从而避免传统中间表示中固有的性能损失。我们方法的核心是多个平行子空间处理视觉表示的层次化架构,由子空间分解模块初始化。为高效增强这些子空间内部及相互之间的相互作用,我们设计了扩散卷积块(DiCB)作为网络主干。此外,我们采用重新参数化流匹配技术直接生成目标潜在向量。这使得在训练期间能够原则性地纳入语音语言模型(SLM)和语义损失,超越传统流匹配目标,提高合成语音质量。我们的实验表明,SLD-L2S 在多个基准数据集上实现了语音合成质量的最先进水平, 在客观和主观评估中均优于现有方法。
引用
@article{arxiv.2602.11477,
title = {SLD-L2S: Hierarchical Subspace Latent Diffusion for High-Fidelity Lip to Speech Synthesis},
author = {Yifan Liang and Andong Li and Kang Yang and Guochen Yu and Fangkun Liu and Lingling Dai and Xiaodong Li and Chengshi Zheng},
journal= {arXiv preprint arXiv:2602.11477},
year = {2026}
}