测试时人类运动控制的多尺度粗到细建模
计算机视觉与模式识别
2026-05-15 v1
摘要
我们提出了 MSCoT(Multi-scale Coarse-to-fine),一种用于测试时人类运动合成与控制的多尺度粗到细模型。与最近依赖于多个迭代去噪/token 预测步骤,或针对特定控制信号定制模块的方法不同,MSCoT 将运动离散化为多尺度层次表示,并以粗到细的方式预测每个时间尺度的整个 token 序列。基于这种粗到细范式,我们提出了一种高效的多尺度 token 指导策略,克服了离散抽样的挑战,引导 token 分布朝向控制目标,以实现快速灵活的控制。为解决离散 codebook 的局限性,一个轻量级 token 精炼器进一步向离散 token 嵌入添加连续残差,允许对测试时精细化优化进行可微分,以确保与控制目标的精确对齐。MSCoT 能够产生符合控制约束的优质运动,同时比基于扩散的方法在抽样速度上显著更快。在流行基准测试上,MSCoT 在现有基线之上实现了可控的 text-to-motion 生成的领先性能,动作质量提升48%(FID 改善),控制精度提高(平均误差降低61%),在 HumanML3D 上推断速度快10倍。
引用
@article{arxiv.2605.14935,
title = {Multi-scale Coarse-to-fine Modeling for Test-time Human Motion Control},
author = {Nhat Le and Daochang Liu and Anh Nguyen and Ajmal Mian},
journal= {arXiv preprint arXiv:2605.14935},
year = {2026}
}