SeeU:通过四维动力学感知生成未见世界
计算机视觉与模式识别
2026-03-31 v2
摘要
图像和视频是四维世界(3D 空间 + 时间)的离散二维投影。大多数视觉理解、预测和生成直接基于二维观测进行,导致次优性能。我们提出 SeeU,一种学习连续四维动力学并生成未见视觉内容的新方法。SeeU 的核心原理是一种新的 2D4D2D 学习框架。SeeU 首先从稀疏的单目二维帧重建四维世界(2D4D)。随后,它在低秩表示和物理约束下学习连续四维动力学(离散 4D连续 4D)。最后,SeeU 将世界沿时间向前推进,在采样时刻和视角下重新投影回二维,并基于时空上下文感知生成未见区域(4D2D)。通过建模四维动力学,SeeU 实现了连续且物理一致的新型视觉生成,在多个任务中展现出强大潜力,包括未见时间生成、未见空间生成和视频编辑。所有数据和代码将在 https://yuyuanspace.com/SeeU/ 公开。
引用
@article{arxiv.2512.03350,
title = {SeeU: Seeing the Unseen World via 4D Dynamics-aware Generation},
author = {Yu Yuan and Tharindu Wickremasinghe and Zeeshan Nadir and Xijun Wang and Yiheng Chi and Stanley H. Chan},
journal= {arXiv preprint arXiv:2512.03350},
year = {2026}
}
备注
Accepted by CVPR 2026. Camera-Ready Version. Project Page: https://yuyuanspace.com/SeeU/