中文

DanceFusion:用于音频驱动舞蹈动作重建的时空骨架扩散Transformer

计算机视觉与模式识别 2024-11-08 v1

摘要

本文提出了DanceFusion,一个利用时空骨架扩散Transformer重建和生成与音乐同步舞蹈动作的新型框架。该框架巧妙处理了社交媒体平台(如TikTok)上短视频中常见的残缺和嘈杂骨骼数据。DanceFusion集成了基于Transformer的层次化变分自编码器(VAE)与扩散模型,显著增强了动作的真实感和准确性。我们的方法引入了复杂的掩码技术和独特的迭代扩散过程,以细化动作序列,确保在动作生成和与伴随音频提示同步方面均具有高保真度。全面评估表明,DanceFusion超越了现有方法,在生成动态、真实且风格多样的舞蹈动作方面达到了最先进的性能。该框架的潜在应用可延伸至内容创作、虚拟现实和互动娱乐,有望在自动化舞蹈生成方面取得重大进展。访问我们的项目页面:https://th-mlab.github.io/DanceFusion/。

关键词

引用

@article{arxiv.2411.04646,
  title  = {DanceFusion: A Spatio-Temporal Skeleton Diffusion Transformer for Audio-Driven Dance Motion Reconstruction},
  author = {Li Zhao and Zhengmin Lu},
  journal= {arXiv preprint arXiv:2411.04646},
  year   = {2024}
}