中文

PoseTalk:基于文本和音频的姿态控制与运动细化的单次说话头生成

计算机视觉与模式识别 2024-09-05 v1 人工智能 多媒体

摘要

虽然之前的音频驱动的说话头生成(THG)方法会从驱动音频中生成头部姿态,但生成的姿态或唇部无法与音频匹配,也无法编辑。本研究提出了PoseTalk系统,能够基于文本提示和音频条件自由生成同步唇部的说话头视频,同时支持自由的头部姿态。我们方法的核心思想是利用头部姿态将视觉、语言和音频信号连接起来。首先,我们提出从音频和文本提示两种方式生成姿态,其中音频提供头部运动的短时变化和节奏对应,而文本提示描述头部运动的长期语义。为实现此目标,我们设计了Pose Latent Diffusion(PLD)模型,在姿态潜在空间中从文本提示和音频线索中生成运动潜。其次,我们注意到一种损失不平衡问题:由于姿态和唇部的损失,唇部区域贡献不到总体重建损失的4%,导致优化倾向于头部运动而非唇部形状。为此,我们提出一种基于细化的学习策略,使用两个级联网络(即CoarseNet和RefineNet)合成自然的说话视频。CoarseNet估计粗糙运动以生成新姿态下的动画图像,而RefineNet专注于通过逐步从低分辨率到高分辨率估计唇部运动来学习更细致的唇部运动,从而提升唇部同步性能。实验表明,我们的姿态预测策略在文本唯一或音频唯一的姿态多样性和真实性方面表现更佳,而我们的视频生成模型在合成具有自然头部运动的说话视频方面超越了当前最先进的方法。项目:https://junleen.github.io/projects/posetalk。

关键词

引用

@article{arxiv.2409.02657,
  title  = {PoseTalk: Text-and-Audio-based Pose Control and Motion Refinement for One-Shot Talking Head Generation},
  author = {Jun Ling and Yiwen Wang and Han Xue and Rong Xie and Li Song},
  journal= {arXiv preprint arXiv:2409.02657},
  year   = {2024}
}

备注

7+5 pages, 15 figures