中文

运动与外观的协同:面向说话人视频生成的多尺度补偿码本

计算机视觉与模式识别 2025-03-26 v2

摘要

说话人视频生成旨在从源图像中保留个人身份,从驾驶视频中获取运动,生成逼真的说话人视频。尽管该领域取得了可喜的进展,但同时保持准确姿态和细粒度面部细节的生成仍然具有挑战性和关键性。本质上,面部运动在精确建模方面高度复杂,且单张源面部图像无法在生成过程中提供足够的外观指导,因为姿态会动态变化。为此,我们提出联合学习运动和外观码本,并进行多尺度码本补偿,以有效细化说话人图像解码的面部运动条件和外观特征。具体而言,设计的多尺度运动和外观码本在统一框架内同步学习,以存储代表性的全局面部运动流和外观模式。随后,我们提出一种新颖的多尺度运动和外观补偿模块,该模块利用基于转换器的代码库检索策略,从两种码本中查询互补信息以进行联合运动和外观补偿。整个过程产生更灵活的运动流和更少失真的外观特征,跨越不同尺度,从而产生高质量的说话人视频生成框架。在 various benchmarks 上进行大量实验验证了我们方法的有效性,并从定性和定量视角显示其在与 SOTA 竞争者比较时的优越生成结果。

关键词

引用

@article{arxiv.2412.00719,
  title  = {Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation},
  author = {Shuling Zhao and Fa-Ting Hong and Xiaoshui Huang and Dan Xu},
  journal= {arXiv preprint arXiv:2412.00719},
  year   = {2025}
}

备注

Accepted by CVPR 2025. Project page: https://shaelynz.github.io/synergize-motion-appearance/