DARES:基于基础模型自监督Vector-LoRA的机器人内窥镜手术深度估计
计算机视觉与模式识别
2024-10-22 v2
摘要
机器人辅助手术(RAS)依赖于准确的深度估计来进行3D重建与可视化。尽管Depth Anything Models(DAM)等基础模型展现出潜力,但将其直接应用于手术往往效果不佳。在有限的手术数据上进行全量微调可能导致过拟合和灾难性遗忘,从而损害模型的鲁棒性和泛化能力。尽管低秩适应(LoRA)解决了一些适应性问题,但其均匀的参数分布忽略了固有的特征层次结构,即学习更通用特征的早期层比后期层需要更多参数。为了解决这个问题,我们引入了机器人内窥镜手术深度估计(DARES),这是一种在DAM V2上采用新型适应技术——向量低秩适应,在RAS场景中执行自监督单目深度估计的新方法。为了提高学习效率,我们通过在早期层集成更多参数并在后期层逐渐减少参数来引入Vector-LoRA。我们还设计了一种基于多尺度SSIM误差的重投影损失,通过更好地使基础模型适应手术环境的特定要求来增强深度感知。所提出的方法在SCARED数据集上得到了验证,并展现出优于近期最先进的自监督单目深度估计技术的性能,在绝对相对误差指标上实现了13.3%的提升。代码和预训练权重可在https://github.com/mobarakol/DARES获取。
引用
@article{arxiv.2408.17433,
title = {DARES: Depth Anything in Robotic Endoscopic Surgery with Self-supervised Vector-LoRA of the Foundation Model},
author = {Mona Sheikh Zeinoddin and Chiara Lena and Jiongqi Qu and Luca Carlini and Mattia Magro and Seunghoi Kim and Elena De Momi and Sophia Bano and Matthew Grech-Sollars and Evangelos Mazomenos and Daniel C. Alexander and Danail Stoyanov and Matthew J. Clarkson and Mobarakol Islam},
journal= {arXiv preprint arXiv:2408.17433},
year = {2024}
}
备注
11 pages