基于混合 Transformer 的特征融合用于自监督单目深度估计
计算机视觉与模式识别
2022-11-22 v1
摘要
随着利用视觉线索导航真实世界的智能体与系统数量空前增长,以及 3D 视觉模型推动力的上升,深度估计的重要性不容低估。虽然监督方法仍是该领域的黄金标准,但训练此类模型所需的大量成对立体数据使其不切实际。自监督和无监督领域的大多数当前最优(SOTA)工作采用基于 ResNet 的编码器架构,从给定输入图像预测视差图,最终与相机位姿估计器一起用于在无直接监督下预测深度。ResNets 的全卷积特性使其易于仅捕获逐像素局部信息,这对深度预测而言是次优的。我们消除这一瓶颈的关键见解是使用 Vision Transformers,其采用自注意力来捕获输入图像中存在的全局上下文信息。我们的模型通过掩码引导的多流卷积在特征空间中融合由两个全卷积深度编码器学习的逐像素局部信息与由 transformer 编码器学习的全局上下文信息,以在不同尺度上实现大多数标准基准上的最优性能。
引用
@article{arxiv.2211.11066,
title = {Hybrid Transformer Based Feature Fusion for Self-Supervised Monocular Depth Estimation},
author = {Snehal Singh Tomar and Maitreya Suin and A. N. Rajagopalan},
journal= {arXiv preprint arXiv:2211.11066},
year = {2022}
}
备注
Presented at the Advances in Image Manipulation Workshop at ECCV 2022