中文

基于视频运动图的音频驱动神经手势重演

计算机视觉与模式识别 2022-07-26 v1

摘要

人类说话时常伴随包括手臂和手部动作在内的身体手势。我们提出一种方法,利用与目标语音音频相匹配的手势对高质量视频进行重演。我们方法的核心思想是通过一种新颖的视频运动图将参考视频中的片段拆分并重新组装,该运动图编码了片段之间的有效过渡。为了无缝连接重演中不同的片段,我们提出了一种姿态感知的视频混合网络,用于合成两个片段之间拼接帧周围的视频帧。此外,我们开发了基于音频的手势搜索算法,以寻找重演帧的最优顺序。我们的系统生成的重演视频既与音频节奏一致,又与语音内容一致。我们从定量、定性以及用户研究方面评估了合成视频的质量,结果表明与先前工作和基线相比,我们的方法生成的视频质量更高且与目标音频的一致性更好。

关键词

引用

@article{arxiv.2207.11524,
  title  = {Audio-driven Neural Gesture Reenactment with Video Motion Graphs},
  author = {Yang Zhou and Jimei Yang and Dingzeyu Li and Jun Saito and Deepali Aneja and Evangelos Kalogerakis},
  journal= {arXiv preprint arXiv:2207.11524},
  year   = {2022}
}

备注

15 pages, 10 figures. Accepted by CVPR 2022