中文

用于舞蹈生成的双向自回归扩散模型

声音 2024-06-25 v4 计算机视觉与模式识别 音频与语音处理

摘要

舞蹈是表达人类情感的有力媒介,但逼真的舞蹈生成仍是一项巨大的挑战。最近,扩散模型在各个领域展现出了卓越的生成能力。由于其灵活的多对多特性,它们在人体运动生成方面具有广阔前景。然而,当前基于扩散模型的运动生成模型通常直接且单向地创建整个运动序列,缺乏对具有局部和双向增强的运动的关注。在编排高质量舞蹈动作时,人们不仅需要考虑音乐上下文,还需要考虑附近与音乐对齐的舞蹈动作。为了真实地捕捉人类行为,我们提出了一种用于音乐到舞蹈生成的双向自回归扩散模型 (BADM),其中构建了一个双向编码器,以强制生成的舞蹈在正向和反向上都保持和谐。为了使生成的舞蹈动作更平滑,构建了一个局部信息解码器用于局部动作增强。所提出的框架能够基于输入条件和附近动作生成新动作,迭代地预见单个动作切片并整合所有预测。为了进一步细化生成舞蹈与节拍之间的同步性,将节拍信息作为输入纳入,以生成更好的与音乐对齐的舞蹈动作。实验结果表明,与现有的单向方法相比,所提出的模型在音乐到舞蹈生成的著名基准上取得了 SOTA 性能。

关键词

引用

@article{arxiv.2402.04356,
  title  = {Bidirectional Autoregressive Diffusion Model for Dance Generation},
  author = {Canyu Zhang and Youbao Tang and Ning Zhang and Ruei-Sung Lin and Mei Han and Jing Xiao and Song Wang},
  journal= {arXiv preprint arXiv:2402.04356},
  year   = {2024}
}