EndoSfM3D:用于自监督基础模型的内窥镜手术场景 3D 重建
计算机视觉与模式识别
2025-10-28 v1
摘要
内窥镜手术场景的 3D 重建在增强场景感知、实现 AR 可视化以及支持图像导向手术中的情境感知决策方面发挥着关键作用。一个关键且具有挑战性的步骤是准确估计内窥镜的内参。在实际手术环境中,内参校准受到 sterility 约束,且使用专用的内窥镜具备连续变焦和望远镜旋转。大多数现有的内窥镜 3D 重建方法不估计内参,限制了其在准确可靠重建方面的效果。本文将内参估计集成到自监督的单目深度估计框架中,通过适配 Depth Anything V2 (DA2) 模型实现深度、姿态和内参的联合预测。我们引入基于注意力的姿态网络和 Weight-Decomposed Low-Rank Adaptation (DoRA) 策略,以高效微调 DA2。我们在 SCARED 和 C3VD 公开数据集上验证了该方法,证明其在自监督单目深度估计和 3D 重建方面优于最近的 SOTA 方法。代码和模型权重可在项目仓库 https://github.com/MOYF-beta/EndoSfM3D 查找。
引用
@article{arxiv.2510.22359,
title = {EndoSfM3D: Learning to 3D Reconstruct Any Endoscopic Surgery Scene using Self-supervised Foundation Model},
author = {Changhao Zhang and Matthew J. Clarkson and Mobarak I. Hoque},
journal= {arXiv preprint arXiv:2510.22359},
year = {2025}
}
备注
11 pages