利用基础模型实现鲁棒且可泛化的六自由度支气管镜定位
计算机视觉与模式识别
2025-06-02 v1
摘要
基于视觉的六自由度支气管镜定位为准确且高性价比的介入导航提供了一种有前景的解决方案。然而,现有方法面临以下挑战:1)由于标注数据稀缺,在不同患者病例间的泛化能力有限;2)在视觉退化下的鲁棒性较差,因为支气管镜手术过程中经常出现遮挡和运动模糊等伪影,损害了视觉信息。为了应对这些挑战,我们提出了 PANSv2,一个可泛化且鲁棒的支气管镜定位框架。PANS 利用多种视觉线索进行位姿似然度测量,受此启发,PANSv2 将深度估计、关键点检测和中线约束集成到一个统一的位姿优化框架中,该框架评估位姿概率并求解最优的支气管镜位姿。为了进一步增强泛化能力,我们利用内窥镜基础模型 EndoOmni 进行深度估计,并利用视频基础模型 EndoMamba 进行关键点检测,结合了空间和时间分析。这些模型在多样化的内窥镜数据集上进行了预训练,可提供稳定且可迁移的视觉表示,从而在各种支气管镜场景下实现可靠的性能。此外,为了提高对视觉退化的鲁棒性,我们引入了一个自动重新初始化模块,该模块检测跟踪失败并在获得清晰视野后利用关键点检测重新建立位姿。在涵盖10个患者病例的支气管镜数据集上的实验结果表明,PANSv2 实现了最高的跟踪成功率,与现有方法相比,SR-5(绝对轨迹误差小于5毫米的百分比)提升了18.1%,展示了向真实临床应用迈进的潜力。
引用
@article{arxiv.2505.24249,
title = {Harnessing Foundation Models for Robust and Generalizable 6-DOF Bronchoscopy Localization},
author = {Qingyao Tian and Huai Liao and Xinyan Huang and Bingyu Yang and Hongbin Liu},
journal= {arXiv preprint arXiv:2505.24249},
year = {2025}
}