中文

面向内窥镜无监督单目深度估计的 Depth Anything 模型提升

计算机视觉与模式识别 2025-07-16 v3 人工智能

摘要

深度估计是 3D 重建的基石, 在 minimally invasive内窥镜手术中发挥着关键作用。然而,目前大多数深度估计网络依赖传统卷积神经网络,这些网络在捕获全局信息方面受限。基石模型提供了一种提升深度估计的有前景的途径,但现有模型主要在自然图像上训练,导致其应用于内窥镜图像时性能不佳。本文引入了一种新的微调策略用于 Depth Anything 模型,并将其集成到基于内在方法的无监督单目深度估计框架中。我们的方法包括基于随机向量的低秩适应技术,以提高模型对不同尺度的适应性。此外,我们提出一种基于深度可分离卷积的残差模块,以补偿变压器捕获局部特征的有限能力。我们的实验结果在 SCARED 数据集和 Hamlyn 数据集上显示,本方法在保持较少可训练参数的同时实现了最新的性能。将此方法应用于 minimally invasive内窥镜手术可增强外科医生的空间感知,从而提高手术的精度和安全性。

关键词

引用

@article{arxiv.2409.07723,
  title  = {Advancing Depth Anything Model for Unsupervised Monocular Depth Estimation in Endoscopy},
  author = {Bojian Li and Bo Liu and Xinning Yao and Jinghua Yue and Fugen Zhou},
  journal= {arXiv preprint arXiv:2409.07723},
  year   = {2025}
}

备注

Accepted by IROS2025, 8 pages, 7 figures