中文

DanceCrafter:基于舞蹈语法的细粒度文本驱动可控舞蹈生成

计算机视觉与模式识别 2026-04-28 v2 人工智能

摘要

文本驱动的可控舞蹈生成尚未得到充分探索,主要由于高质量数据集的严重稀缺以及难以表述复杂的编舞结构。描述舞蹈尤其具有挑战性,因为其复杂的空间动力学、强方向性以及身体不同部位的高度解耦运动。为克服这些瓶颈,我们借鉴了舞蹈研究、人体解剖学和生物力学原理,提出了“舞蹈语法”(Choreographic Syntax)框架,并配套了定制的注释系统。基于该语法,我们结合专业舞蹈档案和高保真动作捕捉数据,构建了DanceFlow——目前最细粒度的舞蹈数据集。它包含41小时的高质量动作,配有634万字的详细描述。模型层面,我们引入DanceCrafter——基于Momentum Human Rig 构建的定制运动转换器。为规避优化不稳定,我们构建了连续的流形运动表示,搭配混合归一化策略。此外,我们设计了基于解剖学的损失函数,显式调节身体部位的解耦性。通过这些改进,DanceCrafter能够实现复杂舞蹈序列的高保真且稳定生成。广泛的评估和用户研究表明,我们的SOTA性能在运动质量、细粒度可控性和生成自然性方面均表现优异。

关键词

引用

@article{arxiv.2604.18648,
  title  = {DanceCrafter: Fine-Grained Text-Driven Controllable Dance Generation via Choreographic Syntax},
  author = {Hang Yuan and Xiaolin Hu and Yan Wan and Menglin Gao and Wenzhe Yu and Cong Huang and Fei Xu and Qing Li and Christina Dan Wang and Zhou Yu and Kai Chen},
  journal= {arXiv preprint arXiv:2604.18648},
  year   = {2026}
}

备注

22 pages, 13 figures