中文

基于共享潜在表示的联合文本-音频-视频合成

计算机视觉与模式识别 2025-11-10 v1

摘要

我们提出了一个利用 HierSpeech++ 中潜在语音表示的文本到说话面部合成框架。Text-to-Vec 模块从文本生成 Wav2Vec2 嵌入,作为语音和面部生成的联合条件。为了处理干净特征与TTS预测特征之间的分布偏移,我们采用两阶段训练:首先在 Wav2Vec2 嵌入上进行预训练,然后在 TTS 输出上进行微调。这实现了紧密的音视频对齐,保留说话人身份,生成自然、有表现力的语音和同步面部动作,无需在推理时使用真实音频。实验表明,条件于TTS预测的潜在特征优于级联管道,显著改善了lip-sync 和视觉真实性。

关键词

引用

@article{arxiv.2511.05432,
  title  = {Shared Latent Representation for Joint Text-to-Audio-Visual Synthesis},
  author = {Dogucan Yaman and Seymanur Akti and Fevziye Irem Eyiokur and Alexander Waibel},
  journal= {arXiv preprint arXiv:2511.05432},
  year   = {2025}
}