中文

DANCER:基于条件强化与扩散模型的舞蹈动画

计算机视觉与模式识别 2025-11-03 v1

摘要

最近,扩散模型在视觉生成任务中展现了惊人的能力。除了静态图像,越来越多的研究关注真实视频的生成。视频生成不仅对质量要求更高,也带来了确保视频连续性的挑战。在所有视频生成任务中,涉及人的内容,例如人的舞蹈,更难生成 due to 与人类运动相关的高度自由度。本文提出一种新型框架,命名为 DANCER (Dance ANimation via Condition Enhancement and Rendering with Diffusion Model),用于基于最新稳定视频扩散模型的真实单人舞蹈合成。由于视频生成通常由参考图像和视频序列引导,我们在框架中引入两个重要模块,以充分利用这两个输入。具体而言,我们设计了 Appearance Enhancement Module (AEM) 以更专注于参考图像的细节进行生成,并通过 Pose Rendering Module (PRM) 将运动引导扩展以捕获 pose 条件。为进一步提升模型的生成能力,我们收集了大量来自互联网的视频数据,并生成了一个名为 TikTok-3K 的新型数据集以增强模型训练。通过在真实数据集上的大量实验评估,我们的模型性能优于当前最先进的方法。所有数据和代码将在接受后公开。

关键词

引用

@article{arxiv.2510.27169,
  title  = {DANCER: Dance ANimation via Condition Enhancement and Rendering with diffusion model},
  author = {Yucheng Xing and Jinxing Yin and Xiaodong Liu},
  journal= {arXiv preprint arXiv:2510.27169},
  year   = {2025}
}