Endo-FASt3r:用于运动恢复结构的内窥镜基础模型适配
计算机视觉与模式识别
2025-08-21 v4
摘要
精确的深度和相机位姿估计对于在机器人辅助手术中实现高质量3D可视化至关重要。尽管基础模型通过自监督学习(SSL)在内窥镜场景的单目深度估计适配方面取得了最新进展,但尚未有先前工作探索将其用于位姿估计。这些方法依赖于低秩适配方法,将模型更新限制在低秩空间内。我们提出了Endo-FASt3r,这是首个在深度和位姿估计两项任务中均使用基础模型的单目SSL深度和位姿估计框架。我们通过设计Reloc3rX扩展了Reloc3r相对位姿估计基础模型,引入了在SSL中收敛所需的修改。我们还提出了DoMoRA,一种能够实现更高秩更新和更快收敛的新型适配技术。在SCARED数据集上的实验表明,与先前工作相比,Endo-FASt3r在位姿估计上实现了10%的显著提升,在深度估计上实现了2%的提升。在Hamlyn和StereoMIS数据集上的类似性能提升证实了Endo-FASt3r在不同数据集上的泛化能力。
引用
@article{arxiv.2503.07204,
title = {Endo-FASt3r: Endoscopic Foundation model Adaptation for Structure from motion},
author = {Mona Sheikh Zeinoddin and Mobarak I. Hoque and Zafer Tandogdu and Greg Shaw and Matthew J. Clarkson and Evangelos Mazomenos and Danail Stoyanov},
journal= {arXiv preprint arXiv:2503.07204},
year = {2025}
}