中文

MVPortrait:面向多视角生动人像动画的文本引导运动与情感控制

计算机视觉与模式识别 2025-03-26 v1

摘要

近期的人像动画方法在生成逼真唇形同步方面取得了显著进展。然而,这些方法通常缺乏对头部运动与面部表情的显式控制,且无法从多视角生成视频,导致动画的可控性与表现力不足。此外,文本引导的人像动画尽管具有用户友好的特性,但仍未得到充分探索。我们提出一种新颖的两阶段文本引导框架 MVPortrait(多视角生动人像,Multi-view Vivid Portrait),用于生成忠实刻画所述运动与情感的多视角人像动画。MVPortrait 首次将 FLAME 作为中间表示,有效地在其参数空间中嵌入面部运动、表情与视角变换。在第一阶段,我们基于文本输入分别训练 FLAME 运动与情感扩散模型。在第二阶段,我们训练一个多视角视频生成模型,其条件为参考人像图像以及第一阶段生成的多视角 FLAME 渲染序列。实验结果表明,MVPortrait 在运动与情感控制以及视角一致性方面均优于现有方法。此外,借助 FLAME 作为桥梁,MVPortrait 成为首个兼容文本、语音与视频作为驱动信号的可控人像动画框架。

关键词

引用

@article{arxiv.2503.19383,
  title  = {MVPortrait: Text-Guided Motion and Emotion Control for Multi-view Vivid Portrait Animation},
  author = {Yukang Lin and Hokit Fung and Jianjin Xu and Zeping Ren and Adela S. M. Lau and Guosheng Yin and Xiu Li},
  journal= {arXiv preprint arXiv:2503.19383},
  year   = {2025}
}

备注

CVPR 2025