中文

Cosh-DiT:基于混合音频-视觉扩散Transformer的共语手势视频合成

计算机视觉与模式识别 2025-03-14 v1

摘要

共语手势视频合成是一项具有挑战性的任务,它既需要对人类手势进行概率建模,又需要合成与语音节奏细微差别相一致的真实图像。为了解决这些挑战,我们提出了Cosh-DiT,一个具有混合扩散Transformer的共语手势视频系统,该系统分别使用离散和连续扩散建模来执行音频到动作和动作到视频的合成。首先,我们引入了一个音频扩散Transformer(Cosh-DiT-A)来合成与语音节奏同步的富有表现力的手势动态。为了捕捉上半身、面部和手部运动先验,我们采用向量量化变分自编码器(VQ-VAEs)在离散潜在空间中联合学习它们的依赖关系。然后,为了在生成的语音驱动运动条件下合成逼真的视频,我们设计了一个视觉扩散Transformer(Cosh-DiT-V),它有效地整合了空间和时间上下文。大量实验表明,我们的框架能够持续生成具有表现力面部表情和自然流畅手势的逼真视频,这些手势与语音无缝对齐。

关键词

引用

@article{arxiv.2503.09942,
  title  = {Cosh-DiT: Co-Speech Gesture Video Synthesis via Hybrid Audio-Visual Diffusion Transformers},
  author = {Yasheng Sun and Zhiliang Xu and Hang Zhou and Jiazhi Guan and Quanwei Yang and Kaisiyuan Wang and Borong Liang and Yingying Li and Haocheng Feng and Jingdong Wang and Ziwei Liu and Koike Hideki},
  journal= {arXiv preprint arXiv:2503.09942},
  year   = {2025}
}

备注

Project Page: https://sunyasheng.github.io/projects/COSH-DIT