ScaleMoGen: 面向人体动作生成的自回归下一尺度预测
计算机视觉与模式识别
2026-05-13 v1
摘要
我们提出了 ScaleMoGen,一个用于文本驱动人体动作生成的尺度级自回归框架。与依赖标准下一词元预测的传统自回归方法不同,ScaleMoGen 将动作生成构建为一个从粗到细的过程。我们将 3D 动作量化为跨多个粒度递增的骨骼-时间尺度的组合离散词元,并通过自回归地预测下一尺度词元图来学习生成动作。为了保持结构完整性,我们的动作分词器和量化器经过专门设计,使得每个尺度上的离散词元都严格保留骨骼层次结构。此外,我们采用了按位量化和预测,这有效地扩大了词元化器的词汇量,以保留动作细节并稳定优化。大量实验表明,ScaleMoGen 达到了最先进的性能,在 HumanML3D 上实现了 0.030 的 FID(对比 MoMask 的 0.045),在 SnapMoGen 数据集上实现了 0.693 的 CLIP 分数(对比 MoMask++ 的 0.685)。此外,我们证明了我们的骨骼-时间多尺度表示自然地促进了无需训练、文本引导的动作编辑。
引用
@article{arxiv.2605.11704,
title = {ScaleMoGen: Autoregressive Next-Scale Prediction for Human Motion Generation},
author = {Inwoo Hwang and Hojun Jang and Bing Zhou and Jian Wang and Young Min Kim and Chuan Guo},
journal= {arXiv preprint arXiv:2605.11704},
year = {2026}
}
备注
Project page: https://inwoohwang.me/ScaleMoGen