基于高效测试时训练的全局一致视频深度与位姿估计
计算机视觉与模式识别
2022-08-05 v1
摘要
稠密深度与位姿估计是各类视频应用的重要前提。传统方案受限于视频中稀疏特征跟踪的鲁棒性不足以及相机基线过短。因此,近期方法利用基于学习的光流与深度先验来估计稠密深度。然而,已有工作要么计算耗时严重,要么得出次优的深度结果。本文提出 GCVD,一种用于基于学习的视频运动恢复结构(SfM)的全局一致方法。GCVD 将紧凑的位姿图集成到基于 CNN 的优化中,通过有效的关键帧选择机制实现全局一致的估计。该方法借助光流引导的关键帧与成熟的深度先验,可提升基于学习方法的鲁棒性。实验结果表明,GCVD 在深度与位姿估计上均优于当前最优(SOTA)方法。此外,运行时间实验显示,其在提供全局一致性的同时,在短期与长期视频中均具备强劲的效率。
引用
@article{arxiv.2208.02709,
title = {Globally Consistent Video Depth and Pose Estimation with Efficient Test-Time Training},
author = {Yao-Chih Lee and Kuan-Wei Tseng and Guan-Sheng Chen and Chu-Song Chen},
journal= {arXiv preprint arXiv:2208.02709},
year = {2022}
}
备注
github: https://github.com/yaochih/GCVD-release