DanceChat:大语言模型引导的音乐到舞蹈生成
计算机视觉与模式识别
2025-08-12 v2 多媒体
声音
音频与语音处理
摘要
音乐到舞蹈生成旨在根据音乐输入合成人类舞蹈动作。尽管近期取得了进展,但由于音乐与舞蹈动作之间的语义鸿沟,仍存在重大挑战,因为音乐仅提供抽象线索,如旋律、律动和情感,而未明确指定物理动作。此外,一段音乐可以产生多种合理的舞蹈解释。这种一对多映射需要额外的指导,因为仅凭音乐为生成多样化的舞蹈动作提供的信息有限。这一挑战因配对音乐和舞蹈数据的稀缺而进一步放大,限制了模型学习多样化舞蹈模式的能力。在本文中,我们提出了DanceChat,一种大语言模型(LLM)引导的音乐到舞蹈生成方法。我们使用LLM作为编舞师,提供文本动作指令,为舞蹈生成提供明确的、高层次的指导。这种方法超越了仅从音乐进行隐式学习,使模型能够生成更加多样化且更好地与音乐风格对齐的舞蹈。我们的方法由三个组件组成:(1)基于LLM的伪指令生成模块,根据音乐风格和结构生成文本舞蹈指导;(2)多模态特征提取与融合模块,将音乐、节奏和文本指导整合为统一表示;以及(3)基于扩散的动作合成模块,连同多模态对齐损失,确保生成的舞蹈与音乐和文本线索均对齐。在AIST++上的广泛实验和人类评估表明,DanceChat在定性和定量方面均优于最先进方法。
引用
@article{arxiv.2506.10574,
title = {DanceChat: Large Language Model-Guided Music-to-Dance Generation},
author = {Qing Wang and Xiaohang Yang and Yilan Dong and Naveen Raj Govindaraj and Gregory Slabaugh and Shanxin Yuan},
journal= {arXiv preprint arXiv:2506.10574},
year = {2025}
}