EndoDAC:用于任意内窥镜相机自监督深度估计的高效适配基础模型
图像与视频处理
2024-05-15 v1 计算机视觉与模式识别
摘要
深度估计在内窥镜手术的多种任务中发挥着关键作用,包括导航、表面重建与增强现实可视化。尽管基础模型在包括深度估计在内的视觉任务中取得了显著成就,但将其直接应用于医疗领域往往导致次优性能。这凸显了采用高效适配方法将这些模型适配于内窥镜深度估计的必要性。我们提出了 Endoscopic Depth Any Camera (EndoDAC),这是一个高效的自监督深度估计框架,可将基础模型适配于内窥镜场景。具体而言,我们开发了 Dynamic Vector-Based Low-Rank Adaptation (DV-LoRA) 并采用 Convolutional Neck 模块,以极少量的可训练参数将基础模型定制于手术领域。鉴于相机信息并非总是可获取,我们还引入了一种自监督适配策略,利用位姿编码器估计相机内参。我们的框架能够仅基于来自任意相机的单目手术视频进行训练,确保了极低的训练成本。实验表明,即使在训练轮数较少且未知真实相机内参的情况下,我们的方法也能获得更优的性能。代码可在 https://github.com/BeileiCui/EndoDAC 获取。
引用
@article{arxiv.2405.08672,
title = {EndoDAC: Efficient Adapting Foundation Model for Self-Supervised Depth Estimation from Any Endoscopic Camera},
author = {Beilei Cui and Mobarakol Islam and Long Bai and An Wang and Hongliang Ren},
journal= {arXiv preprint arXiv:2405.08672},
year = {2024}
}
备注
early accepted by MICCAI 2024