中文

GACA-DiT:基于作品自适应节奏和上下文感知对齐的扩散式舞蹈到音乐生成

声音 2026-03-03 v2 人工智能 多媒体 音频与语音处理

摘要

舞蹈到音乐(D2M)生成旨在自动合成与舞蹈动作在节奏和时间上对齐的音乐。现有方法通常依赖粗糙的节奏嵌入(如全局运动特征或二值化关节-based 的节奏值),这些特征会丢弃细粒度的动作线索,导致节奏对齐较弱。此外,特征下采样引入的时序偏差进一步阻碍了舞蹈与音乐之间的精确同步。为此,我们提出了 GACA-DiT,这是一个基于扩散转换器的框架,包含两个新模块,用于实现节奏一致性和时序对齐的音乐生成。首先,一个作品自适应节奏提取模块结合多尺度时序小波分析和空间相位直方图,加上自适应关节加权,以捕获细粒度、作品自适应的节奏模式。其次,一个上下文感知时序对齐模块使用可学习的上下文查询来解决音乐 latents 与相关舞蹈节奏特征之间的时序偏差。在 AIST++ 和 TikTok 数据集上进行的广泛实验表明,GACA-DiT 在客观指标和人类评估方面均优于最先进的方法。项目页面:https://beria-moon.github.io/GACA-DiT/。

关键词

引用

@article{arxiv.2510.26818,
  title  = {GACA-DiT: Diffusion-based Dance-to-Music Generation with Genre-Adaptive Rhythm and Context-Aware Alignment},
  author = {Jinting Wang and Chenxing Li and Li Liu},
  journal= {arXiv preprint arXiv:2510.26818},
  year   = {2026}
}

备注

5 pages, 4 figures, submitted to Interspeech2026