MoSa:基于可扩展自回归建模的运动生成
计算机视觉与模式识别
2025-11-04 v1
摘要
我们提出MoSa,一种新颖的分层运动生成框架,用于从文本驱动的3D人类运动生成,通过细粒度到粗粒度可扩展生成过程来增强基于向量量化引导的生成转换器(VQ-GT)范式。在MoSa中,我们提出了集成到分层残差向量量化变分自编码器(RQ-VAE)中的多尺度记号保留策略(MTPS)。MTPS在每个分层量化上采用插值,以有效保留细粒度到粗粒度的多尺度记号。借此,生成式转换器支持可扩展自回归(SAR)建模,该模型预测尺度记号,而与传统方法不同,后者在每个步骤仅预测一个记号。因此,MoSa仅需10个推理步骤,匹配RQ-VAE量化层的数量。为解决频繁插值导致的重构退化问题,我们提出了CAQ-VAE,一种轻量且表现力强的卷积注意力混合VQ-VAE。CAQ-VAE增强了残差模块设计,纳入注意力机制以更好地捕获全局依赖。大量实验表明,MoSa在生成质量和效率方面实现了最先进的水平,在保真度和速度上均优于先前方法。在Motion-X数据集上,MoSa实现了FID为0.06(相较于MoMask的0.20),同时将推理时间缩短了27%。此外,MoSa对下游任务如运动编辑具有良好的泛化能力,无需额外微调。代码已公开于https://mosa-web.github.io/MoSa-web
引用
@article{arxiv.2511.01200,
title = {MoSa: Motion Generation with Scalable Autoregressive Modeling},
author = {Mengyuan Liu and Sheng Yan and Yong Wang and Yingjie Li and Gui-Bin Bian and Hong Liu},
journal= {arXiv preprint arXiv:2511.01200},
year = {2025}
}