EndoGMDE:基于低秩专家混合的多样化内窥镜场景泛化单目深度估计
计算机视觉与模式识别
2025-11-04 v3 人工智能
摘要
自监督单目深度估计是内窥镜中低成本、高效的三维场景感知与测量的一项重要任务。然而,光照条件与场景特征的多样性仍然是内窥镜场景深度估计的主要挑战。在本工作中,我们提出了一种用于多样化内窥镜中单目深度估计的新型自监督框架。首先,考虑到具有不同组织的内窥镜场景中的多样特征,提出了一种新型的动态低秩专家分块混合,以高效微调用于内窥镜深度估计的基础模型。在所提出的模块中,基于输入特征,自适应地选择具有少量可训练参数的不同专家进行加权推理,这些低秩专家是根据每个块的泛化能力进行分配的。此外,我们提出了一种新型的自监督训练框架,以共同应对亮度不一致和反射干扰。所提出的方法在 SCARED 数据集和 SimCol 数据集上优于 SOTA 工作。此外,所提出的网络在 C3VD、Hamlyn 和 SERV-CT 数据集上基于零样本深度估计也实现了最佳泛化。我们模型在三维重建和自运动估计中的出色性能得到了进一步证明。所提出的方法可有助于微创测量和手术中的精确内窥镜检查。评估代码将在被接收后发布,演示视频可在以下网址找到:https://endo-gmde.netlify.app/。
引用
@article{arxiv.2509.01206,
title = {EndoGMDE: Generalizable Monocular Depth Estimation with Mixture of Low-Rank Experts for Diverse Endoscopic Scenes},
author = {Liangjing Shao and Chenkang Du and Benshuang Chen and Xueli Liu and Xinrong Chen},
journal= {arXiv preprint arXiv:2509.01206},
year = {2025}
}
备注
12 pages, 12 figures, 7 tables. Under Review