LiftFormer:基于升力理论和帧理论的深度导向子空间单目深度估计
计算机视觉与模式识别
2026-04-09 v1 图像与视频处理
摘要
单目深度估计 (MDE) 近年来受到越来越多的关注,因为其在 3D 视觉中发挥着重要作用。MDE 是从单目图像/视频中估计深度图,以表示场景的 3D 结构,这是一个高度欠定的问题。为解决此问题,本文提出了基于升力理论拓扑学的 LiftFormer,用于构建连接图像颜色特征与深度值之间的中间子空间,以及增强深度预测在边缘附近的子空间。将 MDE 问题形式化为将深度值预测问题转化为深度导向几何表示 (DGR) 子空间特征表示,从而实现从颜色值到几何深度值的学习。基于帧理论构建 DGR 子空间,通过使用按照深度 bin 排列的线性相关向量提供冗余且稳健的表示。将图像空间特征转化为 DGR 子空间,其中这些特征直接对应深度值。此外,考虑到边缘通常在深度图中呈现锐利变化并倾向于产生错误预测,构建了一个边缘感知表示 (ER) 子空间,其中深度特征被转化并进一步用于增强边缘附近的局部特征。实验结果表明,我们的 LiftFormer 在广泛使用的数据集上实现了最先进的性能,消融研究验证了 LiftFormer 中两个提出升力模块的有效性。
引用
@article{arxiv.2604.06576,
title = {LiftFormer: Lifting and Frame Theory Based Monocular Depth Estimation Using Depth and Edge Oriented Subspace Representation},
author = {Shuai Li and Huibin Bai and Yanbo Gao and Chong Lv and Hui Yuan and Chuankun Li and Wei Hua and Tian Xie},
journal= {arXiv preprint arXiv:2604.06576},
year = {2026}
}
备注
Accepted by IEEE Transactions on Multimedia