视频姿态引擎:ViPE 用于 3D 几何感知
计算机视觉与模式识别
2025-08-18 v1 图形学
机器人学
图像与视频处理
摘要
精准的 3D 几何感知是广泛应用空间 AI 系统的重要前提。虽然最先进的方法依赖大规模训练数据,但从野外视频中获取一致且精确的 3D 标注仍是关键挑战。本文介绍了 ViPE,一款便捷且功能多样的视频处理引擎,用于弥合这一差距。ViPE 能够高效地从无约束的原始视频中估计相机内参、相机运动以及密集的近尺度深度图。它对多种场景鲁�洒,包括动态自拍视频、电影镜头或行车记录仪,并支持各种相机模型,如针孔、广角和 360{\deg} 全景相机。我们在多个基准数据集上对 ViPE 进行了评估。值得注意的是,它在 TUM/KITTI 序列上分别比现有未校准姿态估计基准高出 18%/50%,在标准输入分辨率下仅用单张 GPU 即可实现 3-5 FPS 的运行速度。我们使用 ViPE 对大规模视频进行标注,该数据集合包括约 10 万部真实世界互联网视频、100 万部高质量 AI 生成视频和 2000 部全景视频,总计约 9600 万帧——全部标注有准确的相机姿态和密集深度图。我们开源 ViPE 以及标注好的数据集,希望能够加速空间 AI 系统的发展。
引用
@article{arxiv.2508.10934,
title = {ViPE: Video Pose Engine for 3D Geometric Perception},
author = {Jiahui Huang and Qunjie Zhou and Hesam Rabeti and Aleksandr Korovko and Huan Ling and Xuanchi Ren and Tianchang Shen and Jun Gao and Dmitry Slepichev and Chen-Hsuan Lin and Jiawei Ren and Kevin Xie and Joydeep Biswas and Laura Leal-Taixe and Sanja Fidler},
journal= {arXiv preprint arXiv:2508.10934},
year = {2025}
}
备注
Paper website: https://research.nvidia.com/labs/toronto-ai/vipe/