OpenDance:基于大规模互联网数据的多模态可控 3D 舞蹈生成
计算机视觉与模式识别
2025-12-01 v2
摘要
音乐驱动的 3D 舞蹈生成具有显著的创造潜力,但实际应用需要具备灵活和多模态的控制能力。鉴于舞蹈是涵盖多种风格和类型高度动态复杂的人体动作,舞蹈生成需要满足除音乐之外的多种条件(例如空间轨迹、关键帧手势或风格描述)。然而,缺乏大规模且丰富注释的数据集严重阻碍了进展。本文构建了 OpenDanceSet,一个包含超过 100 小时、涵盖 14 种风格和 147 个受试者的人类舞蹈数据集。每个样本都有丰富的注释,以促进稳健的跨模态学习:3D 动作、配对音乐、2D 关键点、轨迹和专家注释的文本描述。此外,我们提出 OpenDanceNet,一个统一的掩码建模框架,用于可控舞蹈生成,包括解�排除自编码器和多模态联合预测 Transformer。OpenDanceNet 支持以音乐和任意文本、关键点或轨迹的任意组合为条件进行生成。全面实验表明,我们的工作实现了高保真合成,具备强大的多样性和真实的物理接触,同时也提供了对空间和风格条件的灵活控制。项目页面:https://open-dance.github.io
引用
@article{arxiv.2506.07565,
title = {OpenDance: Multimodal Controllable 3D Dance Generation with Large-scale Internet Data},
author = {Jinlu Zhang and Zixi Kang and Libin Liu and Jianlong Chang and Qi Tian and Feng Gao and Yizhou Wang},
journal= {arXiv preprint arXiv:2506.07565},
year = {2025}
}