MDD:用于文本与音乐条件下的二人舞动生成的数据集
图形学
2025-08-26 v1 计算机视觉与模式识别
多媒体
声音
摘要
我们介绍多模态二人舞蹈数据集(Multimodal DuetDance, MDD),这是一个为文本控制和音乐条件下的3D二人舞蹈运动生成而设计的多样化多模态基准数据集。该数据集包含由专业舞者演练的620分钟高质量动作捕捉数据,与音乐同步,并配有超过10K条细粒度自然语言描述。注释捕捉了丰富的运动词汇,详细描述了空间关系、身体运动和节奏,使MDD成为第一个无缝集成人类运动、音乐和文本用于二人舞蹈生成的数据集。我们引入了由本数据集支持的两个新任务:(1)文本到二人舞,即给定音乐和文本提示,生成领舞者和随舞者的舞蹈运动;(2)文本到舞蹈伴奏,即给定音乐、文本提示和领舞者的运动,生成符合文本对齐的随舞者运动。我们包括了对两个任务的基线评估,以支持未来研究。
引用
@article{arxiv.2508.16911,
title = {MDD: A Dataset for Text-and-Music Conditioned Duet Dance Generation},
author = {Prerit Gupta and Jason Alexander Fotso-Puepi and Zhengyuan Li and Jay Mehta and Aniket Bera},
journal= {arXiv preprint arXiv:2508.16911},
year = {2025}
}
备注
Accepted at ICCV 2025. Project page: https://gprerit96.github.io/mdd-page