面向水下单目深度估计的物理模型导向混合CNN-Transformer框架——UMono
计算机视觉与模式识别
2024-07-26 v1 人工智能
摘要
水下单目深度估计是3D水下场景重建等任务的基础。然而,由于光线和介质的影响,水下环境经历独特的成像过程,这给准确地从单张图像估计深度带来了挑战。现有方法未充分考虑水下环境的独特特征,导致估计结果不足且泛化性能受限。此外,水下深度估计需要提取和融合局部与全局特征,而现有方法尚未充分探索。本文提出了一种用于水下单目深度估计的端到端学习框架,称为UMono,融入水下图像形成模型的特征,有效利用水下图像的局部与全局特征。实验结果表明,所提方法对水下单目深度估计有效,在定量和定性分析方面均优于现有方法。
引用
@article{arxiv.2407.17838,
title = {UMono: Physical Model Informed Hybrid CNN-Transformer Framework for Underwater Monocular Depth Estimation},
author = {Jian Wang and Jing Wang and Shenghui Rong and Bo He},
journal= {arXiv preprint arXiv:2407.17838},
year = {2024}
}