PerpetualWonder:面向长期 horizon 的动作条件 4D 场景生成
计算机视觉与模式识别
2026-05-21 v2
摘要
我们提出了 PerpetualWonder,一种混合式生成式模拟器,能够从单张图像生成具有长期 horizon 的、动作条件化的 4D 场景。现有方法在此任务上失败,原因在于其物理状态与视觉表征相互脱离,从而无法通过生成式细化来更新后续交互的物理模型。PerpetualWonder 通过引入首个真正的闭环系统来解决这一问题。它包含一种新颖的统一表征,构建了物理状态与视觉原语之间的双向关联,使生成式细化能够同时修正动态行为和外观。它还引入了一种鲁棒的更新机制,从多个视角收集监督信号,以解决优化中的歧义。实验表明,从单张图像出发,PerpetualWonder 能够成功模拟由长期动作驱动的复杂多步骤交互,同时保持物理合理性和视觉一致性。
引用
@article{arxiv.2602.04876,
title = {PerpetualWonder: Long-Horizon Action-Conditioned 4D Scene Generation},
author = {Jiahao Zhan and Zizhang Li and Hong-Xing Yu and Jiajun Wu},
journal= {arXiv preprint arXiv:2602.04876},
year = {2026}
}
备注
Project website: https://johnzhan2023.github.io/PerpetualWonder/