GCDance:基于文本控制的音乐驱动3D 全身舞蹈生成
谱理论
2025-12-11 v2 数学物理
偏微分方程分析
微分几何
math.MP
摘要
音乐驱动的舞蹈生成是一个具有挑战性的任务,因为它需要严格遵循特定风格的编舞,同时确保物理上真实且与音乐的节拍和节奏精确同步。尽管已在音乐条件舞蹈生成方面取得了显著进展,但大多数现有方法难以在生成的舞蹈中传递特定的风格属性。为弥合这一差距,我们提出了一个基于扩散模型的框架,用于在音乐和描述性文本条件下进行风格特定的3D 全身舞蹈生成。为了有效地整合风格信息,我们开发了一种基于文本的控制机制,将输入提示(无论是明确的风格标签还是自由形式的描述性文本)映射到风格特定的控制信号,从而实现对风格一致舞蹈动作的精确和可控的文本引导生成。此外,为增强音乐和文本条件之间的对齐,我们利用音乐基础模型的特征,实现协调且语义对齐的舞蹈合成。最后,为平衡提取文本-风格信息和维持高质量生成结果之间的目标,我们提出了一种新颖的多任务优化策略。这有效平衡了诸如物理真实性、空间准确性和文本分类等竞争因素,显著提高了生成序列的整体质量。在FineDance 和AIST++ 数据集上的大量实验结果表明,GCDance 在现有一流方法之上。
引用
@article{arxiv.2502.18307,
title = {A microlocal pathway to spectral asymmetry: curl and the eta invariant},
author = {Matteo Capoferri and Dmitri Vassiliev},
journal= {arXiv preprint arXiv:2502.18307},
year = {2025}
}
备注
36 pages. v2: minor edits