X-Dancer:富有表现力的音乐至人体舞蹈视频生成
计算机视觉与模式识别
2025-07-14 v2
摘要
我们提出了 X-Dancer,一种新颖的零样本音乐驱动图像动画管线,能够从单张静态图像生成多样且长程的逼真人体舞蹈视频。作为其核心,我们引入了一个统一的 transformer-diffusion 框架,该框架包含一个自回归 transformer 模型,用于合成与音乐同步的扩展的 2D 身体、头部和手部姿态 token 序列,随后引导扩散模型生成连贯且逼真的舞蹈视频帧。与主要在 3D 中生成人体运动的传统方法不同,X-Dancer 通过建模广泛的 2D 舞蹈运动并利用易获取的单目视频捕捉其与音乐节拍的细微对齐,从而解决了数据限制并增强了可扩展性。为实现这一点,我们首先根据与关键点置信度相关的 2D 人体姿态标签构建空间组合 token 表示,编码大型铰接式身体运动(例如上半身和下半身)和细粒度运动(例如头部和手部)。然后,我们设计了一个音乐到运动的 transformer 模型,该模型自回归地生成与音乐对齐的舞蹈姿态 token 序列,并结合了对音乐风格和先前运动上下文的全局注意力。最后,我们利用扩散骨干网络通过 AdaIN 用这些合成的姿态 token 对参考图像进行动画处理,形成一个完全可微的端到端框架。实验结果表明,X-Dancer 能够生成多样且具特征的舞蹈视频,在多样性、表现力和真实感方面显著优于 SOTA 方法。代码和模型将可用于研究目的。
引用
@article{arxiv.2502.17414,
title = {X-Dancer: Expressive Music to Human Dance Video Generation},
author = {Zeyuan Chen and Hongyi Xu and Guoxian Song and You Xie and Chenxu Zhang and Xin Chen and Chao Wang and Di Chang and Linjie Luo},
journal= {arXiv preprint arXiv:2502.17414},
year = {2025}
}
备注
ICCV 2025. Project Page: https://zeyuan-chen.com/X-Dancer/