中文

DanceCamera3D:伴随音乐与舞蹈的三维相机运动合成

计算机视觉与模式识别 2024-03-21 v1 多媒体

摘要

编舞者决定舞蹈的样貌,而摄影师决定舞蹈的最终呈现。近来,多种方法和数据集展示了舞蹈合成的可行性。然而,由于配对数据的稀缺,伴随音乐与舞蹈的相机运动合成仍然是一个尚未解决的挑战性问题。为此,我们提出了 DCM,一个全新的多模态三维数据集,它首次将相机运动与舞蹈动作和音乐音频相结合。该数据集包含来自动漫社区的 108 个舞蹈序列(3.2 小时)的配对舞蹈-相机-音乐数据,涵盖 4 种音乐流派。借助此数据集,我们发现舞蹈相机运动是多方面且以人为中心的,并具有多种影响因素,这使得舞蹈相机合成成为一项比单独的相机或舞蹈合成更具挑战性的任务。为了克服这些困难,我们提出了 DanceCamera3D,一个基于 Transformer 的扩散模型,该模型结合了新颖的身体注意力损失和条件分离策略。为了进行评估,我们设计了衡量相机运动质量、多样性和舞者保真度的新指标。利用这些指标,我们在 DCM 数据集上进行了广泛的实验,提供了定量和定性证据,展示了我们 DanceCamera3D 模型的有效性。代码和视频演示可在 https://github.com/Carmenw1203/DanceCamera3D-Official 获取。

关键词

引用

@article{arxiv.2403.13667,
  title  = {DanceCamera3D: 3D Camera Movement Synthesis with Music and Dance},
  author = {Zixuan Wang and Jia Jia and Shikun Sun and Haozhe Wu and Rong Han and Zhenyu Li and Di Tang and Jiaqing Zhou and Jiebo Luo},
  journal= {arXiv preprint arXiv:2403.13667},
  year   = {2024}
}

备注

Accept to CVPR 2024