中文

PerpetualWonder:面向长期 horizon 的动作条件 4D 场景生成

计算机视觉与模式识别 2026-05-21 v2

摘要

我们提出了 PerpetualWonder,一种混合式生成式模拟器,能够从单张图像生成具有长期 horizon 的、动作条件化的 4D 场景。现有方法在此任务上失败,原因在于其物理状态与视觉表征相互脱离,从而无法通过生成式细化来更新后续交互的物理模型。PerpetualWonder 通过引入首个真正的闭环系统来解决这一问题。它包含一种新颖的统一表征,构建了物理状态与视觉原语之间的双向关联,使生成式细化能够同时修正动态行为和外观。它还引入了一种鲁棒的更新机制,从多个视角收集监督信号,以解决优化中的歧义。实验表明,从单张图像出发,PerpetualWonder 能够成功模拟由长期动作驱动的复杂多步骤交互,同时保持物理合理性和视觉一致性。

关键词

引用

@article{arxiv.2602.04876,
  title  = {PerpetualWonder: Long-Horizon Action-Conditioned 4D Scene Generation},
  author = {Jiahao Zhan and Zizhang Li and Hong-Xing Yu and Jiajun Wu},
  journal= {arXiv preprint arXiv:2602.04876},
  year   = {2026}
}

备注

Project website: https://johnzhan2023.github.io/PerpetualWonder/