中文

三维感知的说话头视频运动迁移

计算机视觉与模式识别 2023-11-07 v1

摘要

说话头视频的运动迁移涉及以主体视频的外观和驱动视频的运动模式生成新视频。当前方法主要依赖于有限数量的主体图像和 2D 表示,从而忽视充分利用主体视频中固有的多视角外观特征。本文提出一种新颖的三维感知说话头视频运动迁移网络 Head3D,其通过循环网络从 2D 主体帧生成视觉可解释的 3D 规范头,充分挖掘主体外观信息。我们方法的关键组件是一个自监督 3D 头部几何学习模块,旨在从 2D 主体视频帧预测头部姿态和深度图。该模块有助于估计规范空间中的 3D 头部,随后可变换以与驱动视频帧对齐。此外,我们采用基于注意力的融合网络,将主体帧的背景及其他细节与 3D 主体头结合以生成合成目标视频。我们在两个公开说话头视频数据集上的大量实验表明,Head3D 在实际跨身份设置下优于 2D 和 3D 已有方法,并有证据表明其可轻松适配于姿态可控的新视角合成任务。

关键词

引用

@article{arxiv.2311.02549,
  title  = {3D-Aware Talking-Head Video Motion Transfer},
  author = {Haomiao Ni and Jiachen Liu and Yuan Xue and Sharon X. Huang},
  journal= {arXiv preprint arXiv:2311.02549},
  year   = {2023}
}

备注

WACV2024