Align3R:用于动态视频的对齐单目深度估计
计算机视觉与模式识别
2024-12-06 v2
摘要
最近的单目深度估计方法发展使单张图像能够实现高质量深度估计,但无法在不同帧之间估计一致的视频深度。最近的研究通过对输入视频应用视频扩散模型来生成视频深度,这种方法训练成本高昂,只能产生尺度不变的深度值且无法获得相机姿态。在本文中,我们提出一种名为 Align3R 的新型视频深度估计方法,用于动态视频。我们的核心思想是利用最近开发的 DUSt3R 模型对不同时间步的估计单目深度图进行对齐。首先,我们以额外的估计单目深度为输入对 DUSt3R 模型进行微调,以适应动态场景。然后,我们应用优化来重建深度图和相机姿态。广泛的实验表明,Align3R 能为单摄像机视频估计出一致的视频深度和相机姿态,性能优于基线方法。
引用
@article{arxiv.2412.03079,
title = {Align3R: Aligned Monocular Depth Estimation for Dynamic Videos},
author = {Jiahao Lu and Tianyu Huang and Peng Li and Zhiyang Dou and Cheng Lin and Zhiming Cui and Zhen Dong and Sai-Kit Yeung and Wenping Wang and Yuan Liu},
journal= {arXiv preprint arXiv:2412.03079},
year = {2024}
}
备注
Project Page: https://igl-hkust.github.io/Align3R.github.io/