中文

AudCast:基于级联扩散 Transformer 的音频驱动人体视频生成

计算机视觉与模式识别 2025-06-10 v1 图形学 多媒体

摘要

尽管音频驱动视频生成近期取得了进展,但现有方法大多专注于驱动面部动作,导致头部与身体动态不协调。向前发展,生成具有准确唇形同步且伴随与给定音频匹配的精细协同语音手势的整体人体视频是理想但具有挑战性的。在本工作中,我们提出了 AudCast,一个通用的音频驱动人体视频生成框架,采用级联 Diffusion-Transformers (DiTs) 范式,基于参考图像和给定音频合成整体人体视频。1) 首先,提出了一种以音频为条件的整体人体 DiT 架构,以直接驱动任意人体的运动并产生生动的手势动态。2) 随后,为了增强公认难以处理的手部和面部细节,区域精修 DiT 利用区域 3D 拟合作为桥梁来重构信号,生成最终结果。大量实验表明,我们的框架生成了具有时间连贯性以及精细面部和手部细节的高保真音频驱动整体人体视频。资源可在 https://guanjz20.github.io/projects/AudCast 获取。

关键词

引用

@article{arxiv.2503.19824,
  title  = {AudCast: Audio-Driven Human Video Generation by Cascaded Diffusion Transformers},
  author = {Jiazhi Guan and Kaisiyuan Wang and Zhiliang Xu and Quanwei Yang and Yasheng Sun and Shengyi He and Borong Liang and Yukang Cao and Yingying Li and Haocheng Feng and Errui Ding and Jingdong Wang and Youjian Zhao and Hang Zhou and Ziwei Liu},
  journal= {arXiv preprint arXiv:2503.19824},
  year   = {2025}
}

备注

Accepted to IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2025. Project page: https://guanjz20.github.io/projects/AudCast