中文

MMGT:用于语音协同手势视频生成的运动掩码引导两阶段网络

计算机视觉与模式识别 2026-03-16 v2

摘要

语音协同手势视频生成旨在从音频驱动的静态图像生成生动的语音视频,由于身体各部位在运动幅度、音频相关性和细节特征方面的多样性,这极具挑战性。仅依赖音频作为控制信号通常无法捕捉视频中大幅度的手势运动,导致产生更明显的伪影和失真。现有方法通常通过添加额外的先验输入来解决这一问题,但这可能会限制该任务的实际应用。具体而言,我们提出了一种运动掩码引导的两阶段网络(MMGT),该网络使用音频以及从音频信号生成的运动掩码和姿态视频,共同生成同步的语音手势视频。在第一阶段,空间掩码引导的 Audio2Pose 生成(SMGA)网络从音频生成高质量的姿态视频和运动掩码,有效捕捉面部和手势等关键区域的大幅度运动。在第二阶段,我们将运动掩码分层音频注意力(MM-HAA)集成到稳定扩散视频生成模型中,解决了传统方法在细粒度运动生成和特定区域细节控制方面的局限性。这确保了生成具有准确纹理和运动的高质量、细节丰富的上半身视频。评估结果表明,视频质量、唇形同步和手势方面均有所提升。模型和代码可在 https://github.com/SIA-IDE/MMGT 获取。

关键词

引用

@article{arxiv.2505.23120,
  title  = {MMGT: Motion Mask Guided Two-Stage Network for Co-Speech Gesture Video Generation},
  author = {Siyuan Wang and Jiawei Liu and Wei Wang and Yeying Jin and Jinsong Du and Zhi Han},
  journal= {arXiv preprint arXiv:2505.23120},
  year   = {2026}
}

备注

Accepted by IEEE TCSVT