中文

利用近场照明提升内窥镜视频的单目深度估计

计算机视觉与模式识别 2024-08-22 v4

摘要

内窥镜视频的单目深度估计可以为辅助和机器人手术提供更好的器官覆盖范围和多种健康问题的检测。尽管主流自然图像深度估计技术取得了显著进展,但在内窥镜图像上表现不佳,这源于缺乏强大的几何特征和挑战性的照明效果。本文利用光度线索,即来自内窥镜发出的光及其被表面反射的光,来改进单目深度估计。我们首先创建两种新型损失函数(监督和自监督变体),利用每个像素的阴影表示。随后,我们提出一种新型深度细化网络(PPSNet),利用相同的每个像素阴影表示。最后,我们引入教师-学生迁移学习,以从具有监督的合成数据和具有自监督的临床数据中产生更好的深度图。我们在 C3VD 数据集上实现了最先进的性能,同时从临床数据中估计出高质量的深度图。我们的代码、预训练模型和补充材料可在项目页面 https://ppsnet.github.io/ 找到。

关键词

引用

@article{arxiv.2403.17915,
  title  = {Leveraging Near-Field Lighting for Monocular Depth Estimation from Endoscopy Videos},
  author = {Akshay Paruchuri and Samuel Ehrenstein and Shuxian Wang and Inbar Fried and Stephen M. Pizer and Marc Niethammer and Roni Sengupta},
  journal= {arXiv preprint arXiv:2403.17915},
  year   = {2024}
}

备注

Accepted to ECCV 2024. 27 pages, 8 tables, 8 figures. Updated to include reference to clinical dataset