ReactDance:用于高保真和连贯长期响应式舞蹈生成的层次表示
计算机视觉与模式识别
2026-03-06 v3 人工智能
机器学习
摘要
响应式舞蹈生成(RDG)是根据主舞者运动生成舞蹈的任务,具有显著提升人机交互和沉浸式数字娱乐的潜力。尽管达尔西同步和运动音乐对齐方面取得了进展,但仍存在两个关键挑战:生成细粒度的空间交互和确保长期时间一致性。本文引入\textbf{ReactDance},一种基于新颖层次潜在空间的扩散框架,以解决RDG中的时空挑战。首先,为实现高保真的空间表达和细粒度控制,我们提出层次化有限标量量化(\textbf{HFSQ})。这种多尺度运动表示有效地解耦粗体姿态与细微肢体动力学,使通过分层引导机制独立且详细地控制两者成为可能。其次,为高效生成高时序连贯性的长序列,我们提出块状局部上下文(\textbf{BLC}),这是一种非自回归采样策略。 departing from慢速的逐帧生成,BLC将序列划分为多个块并通过周期性因果掩码和位置编码并行合成。通过密集滑动窗口训练方法确保这些块之间的连贯性,该方法丰富了局部时序上下文。广泛的实验表明,ReactDance在运动质量、长期连贯性和采样效率方面显著优于当前最先进的方法。项目页面:https://ripemangobox.github.io/ReactDance.
引用
@article{arxiv.2505.05589,
title = {ReactDance: Hierarchical Representation for High-Fidelity and Coherent Long-Form Reactive Dance Generation},
author = {Jingzhong Lin and Xinru Li and Yuanyuan Qi and Bohao Zhang and Wenxiang Liu and Kecheng Tang and Wenxuan Huang and Xiangfeng Xu and Bangyan Li and Changbo Wang and Gaoqi He},
journal= {arXiv preprint arXiv:2505.05589},
year = {2026}
}