中文

基于不确定性全局和局部融合网络的单目结肠摄影图像深度估计泛化

计算机视觉与模式识别 2024-09-24 v1 人工智能

摘要

目标:深度估计对于内窥镜导航和操作至关重要,但在临床场景下(如结肠)获取真实深度图具有挑战性。本研究旨在开发一个在真实结肠摄影图像上具有良好泛化性的框架,克服诸如非朗伯兹表面反射和多样化数据分布等挑战。方法:我们提出了一种框架,将用于捕获局部特征的卷积神经网络(CNN)与用于捕获全局信息的 Transformer 结合起来。设计了基于不确定性的融合模块,以通过识别 CNN 和 Transformer 分支的互补贡献来增强泛化能力。该网络可使用模拟数据集进行训练,并直接泛化到未见的临床数据,而无需任何微调。结果:本方法在多个数据集上进行了验证,显示出在各种数据集和解剖结构上具有卓越的泛化能力。此外,在真实临床场景中的定性分析确认了所提出方法的稳健性。结论:通过 CNN-Transformer 架构集成局部和全局特征,以及基于不确定性的融合模块,提高了在模拟和真实世界内窥镜环境中的深度估计性能和泛化能力。意义:本研究提供了一种在临床环境复杂条件下估计内窥镜图像深度图的新方法,为内窥镜自动导航以及其他临床任务(如结肠息肉检测和分割)奠定了基础。

关键词

引用

@article{arxiv.2409.15006,
  title  = {Generalizing monocular colonoscopy image depth estimation by uncertainty-based global and local fusion network},
  author = {Sijia Du and Chengfeng Zhou and Suncheng Xiang and Jianwei Xu and Dahong Qian},
  journal= {arXiv preprint arXiv:2409.15006},
  year   = {2024}
}