听节奏,选动作:通过扩散和Mamba实现自回归多模态舞蹈生成
图形学
2026-04-08 v3 计算机视觉与模式识别
人机交互
机器学习
声音
摘要
生成模型和序列学习的进展极大推动了舞蹈运动生成的研究,但当前方法仍因语义控制粗糙和长序列连贯性差而受限。本文提出了Listen to Rhythm, Choose Movements (LRCM),一种支持多种输入模态和自回归舞蹈运动生成的多模态引导扩散框架。我们探索了舞蹈数据集的特征解耦范式,并将其推广到Motorica Dance数据集,将动作捕获数据、音频节奏和专业标注的全局和局部文本描述分离。我们的扩散架构集成了音频-潜在Conformer和文本-潜在Cross-Conformer,并包含Motion Temporal Mamba模块(MTMM),以实现平滑、持久的自回归合成。实验结果表明,LRCM在功能能力和定量指标方面均表现出色,展示了在多模态输入场景和长序列生成方面的显著潜力。项目页面位于https://oranduanstudy.github.io/LRCM/。
引用
@article{arxiv.2601.03323,
title = {Listen to Rhythm, Choose Movements: Autoregressive Multimodal Dance Generation via Diffusion and Mamba with Decoupled Dance Dataset},
author = {Oran Duan and Yinghua Shen and Yingzhu Lv and Luyang Jie and Yaxin Liu and Qiong Wu},
journal= {arXiv preprint arXiv:2601.03323},
year = {2026}
}
备注
12 pages, 13 figures