中文

可学习 Patchmatch 与自教学用于单目内窥镜中的多帧深度估计

计算机视觉与模式识别 2025-02-18 v2

摘要

本工作深入研究内窥镜中的无监督单目深度估计,其在训练阶段利用相邻帧建立监督信号。对于许多临床应用(如手术导航),在时间上相关的帧在测试时也是可用的。由于缺乏深度线索,在训练和测试两个阶段充分利用多视频帧间的时间相关性对于准确的深度估计至关重要。然而,内窥镜场景中的若干挑战,如低纹理与同质纹理以及帧间亮度波动,限制了从时间相关性中获得的性能提升。为充分利用该相关性,我们提出了一种新颖的无监督多帧单目深度估计模型。所提模型集成了可学习 patchmatch 模块,以自适应地增强低纹理与同质纹理区域的判别能力,并施加交叉教学与自教学一致性,以针对亮度波动提供有效的正则化。此外,作为自教学模式的一个副产品,所提模型能够在测试时输入更多帧时改善深度预测。我们在多个数据集(包括 SCARED、EndoSLAM、Hamlyn 和 SERV-CT)上进行了详细实验。实验结果表明,我们的模型超越了 SOTA 竞争对手。源代码与训练好的模型将在论文被接收后公开。

关键词

引用

@article{arxiv.2205.15034,
  title  = {Learnable Patchmatch and Self-Teaching for Multi-Frame Depth Estimation in Monocular Endoscopy},
  author = {Shuwei Shao and Zhongcai Pei and Weihai Chen and Xingming Wu and Zhong Liu},
  journal= {arXiv preprint arXiv:2205.15034},
  year   = {2025}
}

备注

14 pages