学习有效适配基础模型用于任意相机下的内窥镜三维场景重建
计算机视觉与模式识别
2025-03-21 v1
摘要
准确的三维场景重建是众多医疗任务的关键。由于获取真实标注数据存在挑战,越来越多关注于内窥镜深度估计的自监督学习(SSL)。虽然基础模型在视觉任务中取得显著进展,但直接应用于医疗领域常常导致结果次优。然而,这些模型的视觉特征仍可提升内窥镜任务,亟需探索高效适配策略。本文引入Endo3DAC框架,实现内窥镜场景重建的高效适配。我们设计集成网络,同时估计深度图、相对姿态和相机内参。通过冻结基础模型 backbone,仅训练特殊设计的门控动态向量基低秩适应(GDV-LoRA)模块,并配合独立解码器头,Endo3DAC在保持训练效率的同时实现优异的深度与姿态估计。此外,我们提出3D场景重建流水线,优化深度图的尺度、偏移及少量参数。广泛实验表明,Endo3DAC在四个内窥镜数据集上均显著优于其他最新方法,所需可训练参数更少。我们是首次利用单一网络仅需手术视频即可完成SSL深度估计与场景重建双重任务。代码将在接受后公开。
引用
@article{arxiv.2503.15917,
title = {Learning to Efficiently Adapt Foundation Models for Self-Supervised Endoscopic 3D Scene Reconstruction from Any Cameras},
author = {Beilei Cui and Long Bai and Mobarakol Islam and An Wang and Zhiqi Ma and Yiming Huang and Feng Li and Zhen Chen and Zhongliang Jiang and Nassir Navab and Hongliang Ren},
journal= {arXiv preprint arXiv:2503.15917},
year = {2025}
}