中文

TM2D:基于音乐-文本融合的双模态驱动三维舞蹈生成

计算机视觉与模式识别 2023-10-03 v2

摘要

我们提出一项生成三维舞蹈动作的新任务,其同时融合文本与音乐两种模态。不同于现有仅使用音乐等单一模态生成舞蹈动作的工作,我们的目标是在文本所提供的指导性信息引导下,生成更丰富的舞蹈动作。然而,缺乏同时具备音乐与文本模态的配对动作数据,限制了生成融合两者舞蹈动作的能力。为缓解这一挑战,我们提出使用三维人体动作 VQ-VAE 将来自两个数据集的动作投影到由量化向量组成的潜空间,从而有效混合具有不同分布的两个数据集的动作 token 用于训练。此外,我们提出一种跨模态 transformer,将文本指令整合进动作生成架构,以生成三维舞蹈动作而不降低音乐条件舞蹈生成的性能。为更好地评估生成动作的质量,我们引入两个新指标,即动作预测距离(MPD)和冻结分数(FS),用于衡量生成动作的连贯性与冻结比例。大量实验表明,我们的方法能够在文本与音乐条件下生成逼真且连贯的舞蹈动作,同时保持与两种单模态相当的性能。代码见 https://garfield-kh.github.io/TM2D/。

关键词

引用

@article{arxiv.2304.02419,
  title  = {TM2D: Bimodality Driven 3D Dance Generation via Music-Text Integration},
  author = {Kehong Gong and Dongze Lian and Heng Chang and Chuan Guo and Zihang Jiang and Xinxin Zuo and Michael Bi Mi and Xinchao Wang},
  journal= {arXiv preprint arXiv:2304.02419},
  year   = {2023}
}

备注

Accepted by ICCV2023