中文

SAMPO:基于运动提示的尺度级自回归生成世界模型

计算机视觉与模式识别 2025-10-22 v2 机器人学

摘要

世界模型允许智能体在想象的环境中模拟动作的后果,以用于规划、控制和长期决策。然而,现有的自回归世界模型因空间结构被破坏、解码效率低以及运动建模不足,难以产生视觉上连贯的预测。为此,我们提出了基于尺度级自回归与运动提示(SAMPO)框架,将视觉自回归建模用于帧内生成,同时采用因果建模用于下一帧生成。具体而言,SAMPO集成了时序因果解码与双向空间注意力机制,既保留了空间局部性,又支持每个尺度内的并行解码。该设计显著提升了时序一致性和 rollout 效率。为进一步增强动态场景理解,我们设计了非对称多尺度 tokenizer,既保留观测帧中的空间细节,又为后续帧提取紧凑的动态表示,优化了内存使用和模型性能。此外,我们引入轨迹感知运动提示模块,将关于物体和机器人轨迹的时空线索注入注意力机制,聚焦动态区域,提高了时序一致性和物理真实性。大量实验表明,SAMPO在动作条件视频预测和模型基控制中表现出竞争力,生成质量提升约为 4.4×4.4\times 推理速度加快。我们还评估了SAMPO的零样本泛化和规模化行为,表明其能够对未见任务进行泛化,并从更大的模型规模中受益。

关键词

引用

@article{arxiv.2509.15536,
  title  = {SAMPO:Scale-wise Autoregression with Motion PrOmpt for generative world models},
  author = {Sen Wang and Jingyi Tian and Le Wang and Zhimin Liao and Jiayi Li and Huaiyi Dong and Kun Xia and Sanping Zhou and Wei Tang and Hua Gang},
  journal= {arXiv preprint arXiv:2509.15536},
  year   = {2025}
}

备注

22 pages,15 figures