将音乐驱动的二维舞姿生成重新定义为多通道图像生成
计算机视觉与模式识别
2025-12-15 v1
摘要
最近的姿态到视频模型可以将2D姿态序列翻译为照片级、身份保持的舞蹈视频,因此关键挑战是从音乐中生成时序连贯、节奏对齐的2D姿态,尤其是在面对复杂且高度变异的野外分布。我们通过将音乐到舞蹈生成重新定义为音乐标记条件下的多通道图像合成问题来解决这一挑战:将2D姿态序列编码为 one-hot 图像,通过预训练的图像VAE压缩,并使用DiT风格的 backbone 模型建模,从而继承现代文本到图像模型的架构和训练优势,更好地捕获高变异的2D姿态分布。在此表述之上,我们引入(i)一种时段共享的时间索引方案,显式地在时间上同步音乐标记和姿态潜在表示,以及(ii)一种参考姿态条件策略,既保留受体特定的身体比例和屏幕尺度,又能实现长期段落的分段-拼接生成。实验在大型野外2D舞蹈语料库和校准的AIST++2D基准上表明,相对于代表性的音乐到舞蹈方法,在姿态空间和视频空间指标以及人类偏好方面均实现了持续的改进,消融实验验证了表示、时间索引和参考条件的贡献。补充视频请访问 https://hot-dance.github.io
引用
@article{arxiv.2512.11720,
title = {Reframing Music-Driven 2D Dance Pose Generation as Multi-Channel Image Generation},
author = {Yan Zhang and Han Zou and Lincong Feng and Cong Xie and Ruiqi Yu and Zhenpeng Zhan},
journal= {arXiv preprint arXiv:2512.11720},
year = {2025}
}