ST-GDance++:用于长时程群体舞蹈的可扩展时空扩散方法
机器学习
2026-03-25 v1 人工智能
计算机视觉与模式识别
声音
摘要
从音乐生成群体舞蹈需要同步多个舞者的动作,同时保持空间协调,这使其在电影制作、游戏和动画等应用中具有高度相关性。近期的群体舞蹈生成模型已取得鼎舞的生成质量,但由于双向注意力依赖,难以在交互式场景中部署。随着舞者数量和序列长度的增加,为对齐音乐条件与动作序列所需的注意力计算呈二次增长,导致效率下降和运动碰撞风险增加。有效建模密集的时空相互作用因此至关重要,而现有方法往往难以捕捉这种复杂性,导致可扩展性受限和多舞者协调不稳定。为此,我们提出ST-GDance++,一种可扩展框架,通过解耦时空依赖来实现高效且具备碰撞意识的群体编舞生成。对于空间建模,我们引入轻量级距离感知图卷积,以捕捉舞者间关系,同时降低计算开销。对于时序建模,我们设计一种扩散噪声调度策略,搭配高效时序对齐注意力掩码,实现长运动序列的流式生成,提升长时程场景的可扩展性。在AIOZ-GDance数据集上的实验表明,ST-GDance++在竞争性生成质量方面显著优于现有方法,同时将延迟大幅降低。
引用
@article{arxiv.2603.22316,
title = {ST-GDance++: A Scalable Spatial-Temporal Diffusion for Long-Duration Group Choreography},
author = {Jing Xu and Weiqiang Wang and Cunjian Chen and Jun Liu and Qiuhong Ke},
journal= {arXiv preprint arXiv:2603.22316},
year = {2026}
}