中文

面向普通话的词汇音调感知式唇语合成——基于跨语言迁移学习的LTA-L2S

声音 2025-10-01 v1 计算机视觉与模式识别

摘要

唇语合成(L2S)对于普通话来说是一项重大挑战,主要受限于复杂的视音素到音素映射关系以及词汇音调在语音清晰度中的关键作用。为此,我们提出了词汇音调感知式唇语合成方法(LTA-L2S)。为解决视音素到音素的复杂问题,我们的模型通过跨语言迁移学习策略,对一款针对英语预训练的音视频自监督学习(SSL)模型进行适配。该策略不仅将从大量英语数据中学习到的通用知识迁移到普通话领域,还规避了从头训练此类模型的高昂成本。为特别建模词汇音调并提升语音清晰度,我们进一步采用流匹配模型生成F0音高轮廓。该生成过程由基于ASR微调的SSL语音单元引导,语音单元中包含关键的超段信息。通过两阶段训练范式最终提升语音质量,其中流匹配后处理网络(postnet)对第一阶段生成的粗糙频谱进行细化。大量实验表明,LTA-L2S在语音清晰度和音调准确性方面均显著优于现有方法。

关键词

引用

@article{arxiv.2509.25670,
  title  = {LTA-L2S: Lexical Tone-Aware Lip-to-Speech Synthesis for Mandarin with Cross-Lingual Transfer Learning},
  author = {Kang Yang and Yifan Liang and Fangkun Liu and Zhenping Xie and Chengshi Zheng},
  journal= {arXiv preprint arXiv:2509.25670},
  year   = {2025}
}

备注

Submitted to ICASSP 2026