中文

SeeU:通过四维动力学感知生成未见世界

计算机视觉与模式识别 2026-03-31 v2

摘要

图像和视频是四维世界(3D 空间 + 时间)的离散二维投影。大多数视觉理解、预测和生成直接基于二维观测进行,导致次优性能。我们提出 SeeU,一种学习连续四维动力学并生成未见视觉内容的新方法。SeeU 的核心原理是一种新的 2D\to4D\to2D 学习框架。SeeU 首先从稀疏的单目二维帧重建四维世界(2D\to4D)。随后,它在低秩表示和物理约束下学习连续四维动力学(离散 4D\to连续 4D)。最后,SeeU 将世界沿时间向前推进,在采样时刻和视角下重新投影回二维,并基于时空上下文感知生成未见区域(4D\to2D)。通过建模四维动力学,SeeU 实现了连续且物理一致的新型视觉生成,在多个任务中展现出强大潜力,包括未见时间生成、未见空间生成和视频编辑。所有数据和代码将在 https://yuyuanspace.com/SeeU/ 公开。

关键词

引用

@article{arxiv.2512.03350,
  title  = {SeeU: Seeing the Unseen World via 4D Dynamics-aware Generation},
  author = {Yu Yuan and Tharindu Wickremasinghe and Zeeshan Nadir and Xijun Wang and Yiheng Chi and Stanley H. Chan},
  journal= {arXiv preprint arXiv:2512.03350},
  year   = {2026}
}

备注

Accepted by CVPR 2026. Camera-Ready Version. Project Page: https://yuyuanspace.com/SeeU/