基于共享潜在表示的联合文本-音频-视频合成
计算机视觉与模式识别
2025-11-10 v1
摘要
我们提出了一个利用 HierSpeech++ 中潜在语音表示的文本到说话面部合成框架。Text-to-Vec 模块从文本生成 Wav2Vec2 嵌入,作为语音和面部生成的联合条件。为了处理干净特征与TTS预测特征之间的分布偏移,我们采用两阶段训练:首先在 Wav2Vec2 嵌入上进行预训练,然后在 TTS 输出上进行微调。这实现了紧密的音视频对齐,保留说话人身份,生成自然、有表现力的语音和同步面部动作,无需在推理时使用真实音频。实验表明,条件于TTS预测的潜在特征优于级联管道,显著改善了lip-sync 和视觉真实性。
引用
@article{arxiv.2511.05432,
title = {Shared Latent Representation for Joint Text-to-Audio-Visual Synthesis},
author = {Dogucan Yaman and Seymanur Akti and Fevziye Irem Eyiokur and Alexander Waibel},
journal= {arXiv preprint arXiv:2511.05432},
year = {2025}
}