面向音视频叙述的提示引导式音视觉叙述面部生成:多 entangled 潜在空间
计算机视觉与模式识别
2026-02-24 v1
摘要
我们提出了一种新方法,用于生成逼真的说话和说话人脸,通过从静态图像、语音轮廓和目标文本合成人的语音和面部动作。该模型对提示/驱动文本、驱动图像和个人的语音轮廓进行编码,然后将其组合通过多 entangled 潜在空间,以促进音频和视频模态生成管道中的关键-值对和查询。多 entangled 潜在空间负责在模态之间建立人类特有的时空特征。随后,entangled 特征传递给各自模态的解码器,用于输出音频和视频生成。
引用
@article{arxiv.2602.18618,
title = {Narrating For You: Prompt-guided Audio-visual Narrating Face Generation Employing Multi-entangled Latent Space},
author = {Aashish Chandra and Aashutosh A and Abhijit Das},
journal= {arXiv preprint arXiv:2602.18618},
year = {2026}
}
备注
To appear in the Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026. Presented at Poster Session 1