中文

DanceAnyWay:基于随机时间对比学习合成节拍引导的 3D 舞蹈

声音 2024-11-26 v3 图形学 多媒体 音频与语音处理

摘要

我们提出 DanceAnyWay,一种用于合成与音乐同步的节拍引导 3D 人体角色舞蹈的生成式学习方法。我们的方法通过在两个层次级别上操作,学习将节拍帧处的舞蹈动作与所有其余帧处的舞蹈动作解耦。在较粗的“节拍”层级,它仅于节拍帧处通过专用特征表示编码输入音乐的节奏、音高与旋律信息,并利用序列到序列学习框架合成目标舞蹈的节拍姿态。在较细的“补全”层级,我们的方法通过专用特征表示从输入音乐的所有帧编码相似的节奏、音高与旋律信息,并将合成的节拍与补全姿态结合,通过对抗学习框架强制合理性,从而生成完整舞蹈序列。我们的训练范式还通过随机时间对比损失强制合成舞蹈中的细粒度多样性,确保舞蹈序列的不同片段具有不同动作,避免运动冻结或坍缩为重复动作。我们在基准 AIST++ 数据集上通过大量实验评估了方法性能,观察到相比当前基线,运动质量指标提升约 7%–12%,运动多样性指标提升 1.5%–4%。我们还进行了用户研究以评估合成舞蹈的视觉质量。注意到,平均而言,参与者对我们方法生成的样本偏好度高约 9%–48%,且在运动质量与同步性上较现有最佳基线获得高 4%–27% 的五点 Likert 量表评分。我们的源代码与项目页面见 https://github.com/aneeshbhattacharya/DanceAnyWay。

关键词

引用

@article{arxiv.2303.03870,
  title  = {DanceAnyWay: Synthesizing Beat-Guided 3D Dances with Randomized Temporal Contrastive Learning},
  author = {Aneesh Bhattacharya and Manas Paranjape and Uttaran Bhattacharya and Aniket Bera},
  journal= {arXiv preprint arXiv:2303.03870},
  year   = {2024}
}

备注

11 pages, 7 figures, 3 tables. To appear as part of the proceedings of the 38th Annual AAAI Conference on Artificial Intelligence, 2024