解锁 3D 视觉几何估计的关键因素之力
计算机视觉与模式识别
2026-04-24 v1
摘要
前馆视觉几何估计最近取得了快速进展。然而仍存在一个重要差距:多帧模型通常在跨帧一致性方面表现更好,但在单帧精度上常不如强大的单帧方法。这一观察促使我们系统性地调查驱动模型性能的关键因素,通过严谨的消融研究揭示了若干关键见解:1) 扩大数据多样性与质量即使在最先进的视觉几何估计方法中,也能进一步提升性能;2) 常用的 confidence-aware loss 与梯度-based loss 机制可能无意中阻碍性能;3) 通过 per-sequence 与 per-frame 对齐的联合监督可提升结果,而局部区域对齐反而会降低性能。此外,我们引入两个增强措施以整合优化-based 方法与高分辨率输入的优势:一个 enforce depth maps、camera parameters 与 point maps 对齐的 consistency loss 函数,以及一种高效的网络架构设计,利用高分辨率信息。我们将这些设计集成到 CARVE 中,这是一个针对前馆视觉几何估计的分辨率增强模型。在点云重建、视频深度估计以及相机位姿/内参估计等任务上,CARVE 在 diverse benchmarks 上实现了强大且稳健的性能。
引用
@article{arxiv.2604.21713,
title = {Unlocking the Power of Critical Factors for 3D Visual Geometry Estimation},
author = {Guangkai Xu and Hua Geng and Huanyi Zheng and Songyi Yin and Yanlong Sun and Hao Chen and Chunhua Shen},
journal= {arXiv preprint arXiv:2604.21713},
year = {2026}
}
备注
Accepted to CVPR 2026. GitHub Page: https://github.com/aim-uofa/CARVE