中文

手术场景深度估计: 基于基础模型的 Surgical Depth Anything

计算机视觉与模式识别 2024-10-11 v1

摘要

单目深度估计对于跟踪和重建算法尤为重要,尤其是在手术视频的语境下。然而,由于在手术过程中难以直接获取真实深度图,基于监督学习的方法便难以实践。虽然许多基于结构从运动 (Structure from Motion, SfM) 的自监督方法取得了令人鼓舞的成果,但这些方法高度依赖高质量的相机运动,并需针对每个患者进行优化。这些局限性可通过利用当前深度估计的最先进基础模型 Depth Anything 来加以缓解。然而,直接将 Depth Anything 应用于手术场景时,仍面临模糊、出血和反射等问题,导致性能不佳。本文针对手术领域对 Depth Anything 模型进行微调,以提供量身定制的像素级深度图,满足手术环境独特需求与挑战。我们的微调方法显著提升了模型在手术场景中的性能,减少了模糊和反射相关的误差,实现更可靠、更精确的深度估计。

关键词

引用

@article{arxiv.2410.07434,
  title  = {Surgical Depth Anything: Depth Estimation for Surgical Scenes using Foundation Models},
  author = {Ange Lou and Yamin Li and Yike Zhang and Jack Noble},
  journal= {arXiv preprint arXiv:2410.07434},
  year   = {2024}
}