Surgical-DINO:内镜手术深度估计中基础模型的适配器学习
计算机视觉与模式识别
2024-01-15 v2 人工智能
摘要
目的:机器人手术中的深度估计对于三维重建、手术导航和增强现实可视化至关重要。尽管基础模型在包括深度估计在内的许多视觉任务中表现出色(例如 DINOv2),但近期工作观察到其在医学和手术领域特定应用中的局限性。本工作提出了一种用于手术深度估计的基础模型的低秩适配(LoRA)。方法:我们设计了一种基于基础模型的深度估计方法,称为 Surgical-DINO,它是 DINOv2 的低秩适配,用于内镜手术中的深度估计。我们构建了 LoRA 层并将其集成到 DINO 中,以适应手术领域的特定知识,而非传统的微调。在训练期间,我们冻结了表现出卓越视觉表征能力的 DINO 图像编码器,仅优化 LoRA 层和深度解码器,以整合来自手术场景的特征。结果:我们的模型在 MICCAI 挑战数据集 SCARED 上进行了广泛验证,该数据集采集自 da Vinci Xi 内镜手术。我们通过实验表明,Surgical-DINO 在内镜深度估计任务中显著优于所有最先进的模型。消融研究分析证明了我们的 LoRA 层和适配的显著效果。结论:Surgical-DINO 为基础模型成功适配到手术领域进行深度估计提供了一些启示。结果中有明确证据表明,在计算机视觉数据集上进行预训练权重的零样本预测或简单的微调,不足以直接将该基础模型用于手术领域。代码可在 https://github.com/BeileiCui/SurgicalDINO 获取。
引用
@article{arxiv.2401.06013,
title = {Surgical-DINO: Adapter Learning of Foundation Models for Depth Estimation in Endoscopic Surgery},
author = {Beilei Cui and Mobarakol Islam and Long Bai and Hongliang Ren},
journal= {arXiv preprint arXiv:2401.06013},
year = {2024}
}
备注
Accepted by IPCAI 2024 (IJCAR Special Issue)