中文

Dance Any Beat: 将节拍与视觉内容融合于舞蹈视频生成

计算机视觉与模式识别 2024-12-02 v3 人工智能 多媒体 声音 音频与语音处理

摘要

从音乐生成舞蹈动作对于推动自动化编舞具有重要意义。当前方法通常生成骨架关键点序列,无法生成舞蹈视频,且缺乏针对特定个体进行舞蹈的能力,限制了其实际应用场景。这些方法还需要精确的关键点标注,增加了数据收集的复杂度,限制了自采集视频数据集的使用。为克服这些挑战,本文提出了一种新任务:从个体的图片中生成舞蹈视频。该任务无需关键点标注,即可为特定个体生成舞蹈,具有更大的灵活性和适用性。我们的解决方案是Dance Any Beat扩散模型(DabFusion),它利用参考图像和音乐文件生成包含多种舞蹈类型和编排的舞蹈视频。音乐由专门设计的音乐编码器分析,识别包括舞蹈风格、动作和节奏等关键特征。DabFusion不仅能为训练数据集中的个体生成舞蹈视频,还能为任何之前未出现的个体生成。这种灵活性源于其生成潜在光流的做法,光流包含动画化图像中所需的所有运动信息。我们使用AIST++数据集评估DabFusion的性能,关注视频质量、音视频同步以及运动与音乐的对齐。我们提出了2D Motion-Music Alignment Score(2D-MM Align),该指标基于Beat Alignment Score,更有效地评估此新任务的运动与音乐对齐。实验表明,DabFusion为这一创新任务建立了坚实的基准。视频结果可在项目页面https://DabFusion.github.io查看。

关键词

引用

@article{arxiv.2405.09266,
  title  = {Dance Any Beat: Blending Beats with Visuals in Dance Video Generation},
  author = {Xuanchen Wang and Heng Wang and Dongnan Liu and Weidong Cai},
  journal= {arXiv preprint arXiv:2405.09266},
  year   = {2024}
}

备注

WACV2025, 11 pages, 7 figures, demo page: https://DabFusion.github.io