基于自然语言查询的多模态单镜头内视内窥镜深度与姿态估计
计算机视觉与模式识别
2026-02-23 v1
摘要
单镜头深度与姿态估计在结肠内窥镜导航开发中发挥着重要作用,因为它们能够通过减少盲区、降低漏诊或复发病灶的风险以及降低未完成检查的可能性来提高筛查效果。然而,由于存在纹理稀缺的表面、复杂的照明模式、形变以及缺乏可靠真实 ground truth 的 in-vivo 数据集,该任务仍然具有挑战性。本文提出 **PRISM**(姿态细化结合内在光照和边缘图),一个基于自监督学习的框架,利用解剖先验和光照先验来指导几何学习。我们的方法独特地融合了边缘检测和亮度分离以实现结构引导。具体而言,边缘图通过学习基于的边缘检测器(例如 DexiNed 或 HED)生成,该检测器旨在捕捉细小和高频边界;而亮度分离则通过一种本征分解模块获得,该模块将光照和反射分离,从而使模型能够利用光照线索进行深度估计。在多个真实和合成数据集上的实验结果表明,我们的方法在性能上达到最先进的水平。我们进一步对训练数据选择进行了详尽的消融研究,以在结肠镜中建立姿态和深度估计的最佳实践。该分析得出两个实用见解: (1) 在真实世界数据上进行自监督训练优于在真实感幻影数据上进行监督训练,凸显了域现实感的优势高于 ground truth 可用性; (2) 视频帧率是模型性能的极其重要因素,其中数据集特定的视频帧抽样对于生成高质量训练数据至关重要。
引用
@article{arxiv.2602.17785,
title = {Multi-Modal Monocular Endoscopic Depth and Pose Estimation with Edge-Guided Self-Supervision},
author = {Xinwei Ju and Rema Daher and Danail Stoyanov and Sophia Bano and Francisco Vasconcelos},
journal= {arXiv preprint arXiv:2602.17785},
year = {2026}
}
备注
14 pages, 6 figures; early accepted by IPCAI2026