中文

面向一致视频几何估计

计算机视觉与模式识别 2026-05-29 v1

摘要

本工作提出了 ViGeo,一个用于从视频序列中恢复空间稠密且时间一致几何的前馈基础模型。基于标准的变换器架构构建,无需任务特定的架构修改,ViGeo 支持流式、整序列和长视频推理。其关键设计是动态分块注意力机制,使模型在训练期间暴露于双向和因果时间上下文,允许其在测试时无需重新训练地适应其注意力模式。为提高监督质量,我们进一步引入了基于完成的数据细化框架。该框架训练一个基于稀疏和噪声注释并利用视频/多视图上下文来产生稠密、时序一致且几何可靠训练目标的视频深度完成教师。除了深度和点图之外,ViGeo 还能在同一框架内预测表面法线。仅使用公开数据集训练,ViGeo 在在线、离线和长视频深度估计、表面法线估计和视频点图估计方面均实现了最先进的性能。

关键词

引用

@article{arxiv.2605.30060,
  title  = {Towards Consistent Video Geometry Estimation},
  author = {Zhu Yu and Jingnan Gao and Runmin Zhang and Lingteng Qiu and Zhengyi Zhao and Rui Peng and Yichao Yan and Kejie Qiu and Siyu Zhu and Si-Yuan Cao and Hui-Liang Shen},
  journal= {arXiv preprint arXiv:2605.30060},
  year   = {2026}
}

备注

Project webpage: https://pkqbajng.github.io/ViGeo/