中文

洞悉世界动态:NutWorld 框架

计算机视觉与模式识别 2025-03-18 v2 人工智能 图形学 多媒体

摘要

我们考虑以空间和时间上连贯的方式高效表示随意拍摄的单目视频的问题。现有方法主要依赖将视频视为时空像素集合的2D/2.5D技术,但由于缺乏时间连贯性和显式的3D结构,它们难以处理复杂运动、遮挡和几何一致性。受单目视频作为动态3D世界投影的启发,我们探索通过时空中高斯原语的连续流来表示视频的内在3D形式。在本文中,我们提出了 NutWorld,这是一个新颖的框架,能够在单次前向传递中高效地将单目视频转换为动态3D高斯表示。其核心在于,NutWorld 引入了一种结构化的时空对齐高斯(STAG)表示,通过有效的深度和光流正则化实现无需优化的场景建模。通过全面的实验,我们证明 NutWorld 实现了高保真视频重建质量,同时支持各种实时下游应用。演示和代码将在 https://github.com/Nut-World/NutWorld 上提供。

关键词

引用

@article{arxiv.2502.03465,
  title  = {Seeing World Dynamics in a Nutshell},
  author = {Qiuhong Shen and Xuanyu Yi and Mingbao Lin and Hanwang Zhang and Shuicheng Yan and Xinchao Wang},
  journal= {arXiv preprint arXiv:2502.03465},
  year   = {2025}
}