中文

面向文本到运动生成的下一尺度自回归模型

计算机视觉与模式识别 2026-05-28 v2

摘要

自回归(AR)模型具有稳定高效的训练优势,但标准的下一个标记预测与文本条件化运动生成所需的时序结构不够契合。我们提出MoScale,一种从粗到细的时序分辨率分层生成运动的下一尺度AR框架。通过在最粗尺度上提供全局语义并逐层细化,MoScale建立了更适合长程运动结构的因果层级结构。为提高在有限文本-运动数据下的鲁棒性,我们进一步引入跨尺度层级细化以改进每个尺度的初始预测,并在尺度内进行选择性双向重预测。MoScale以高训练效率实现了SOTA文本到运动性能,模型规模扩展效果佳,并能零样本推广至多样化的运动生成和编辑任务。

关键词

引用

@article{arxiv.2604.03799,
  title  = {Next-Scale Autoregressive Models for Text-to-Motion Generation},
  author = {Zhiwei Zheng and Shibo Jin and Lingjie Liu and Mingmin Zhao},
  journal= {arXiv preprint arXiv:2604.03799},
  year   = {2026}
}

备注

Accepted to CVPR 2026