中文

ZipMap:基于测试时训练的线性时间有状态 3D 重建

计算机视觉与模式识别 2026-04-10 v3 人工智能 机器学习

摘要

前馈变换器模型推动了 3D 视觉的快速进展,但诸如 VGGT 和 π3\pi^3 等前沿方法的计算复杂度随输入图像数量呈二次增长,使得在大图像集合上应用时效率低下。顺序重建方法可降低此开销,但牺牲了重建质量。我们引入 ZipMap,一种有状态的前馈模型,实现了线性时间、双向 3D 重建,同时匹配或超越了二次时间方法的精度。ZipMap 采用测试时训练层将整个图像集合压缩到紧凑的隐藏场景状态中,仅通过一次前向传播即可完成,从而在单张 H100 GPU 上在 10 秒内重建超过 700 帧,速度是 VGGT 等前沿方法的 20 倍以上。此外,我们展示了在实时场景状态查询和其扩展到顺序流式重建方面的有状态表示的优势。

关键词

引用

@article{arxiv.2603.04385,
  title  = {ZipMap: Linear-Time Stateful 3D Reconstruction via Test-Time Training},
  author = {Haian Jin and Rundi Wu and Tianyuan Zhang and Ruiqi Gao and Jonathan T. Barron and Noah Snavely and Aleksander Holynski},
  journal= {arXiv preprint arXiv:2603.04385},
  year   = {2026}
}

备注

Project page: https://haian-jin.github.io/ZipMap