BronchOpt:基于微调基础模型的视觉基于姿态优化用于精确支气管镜导航
计算机视觉与模式识别
2025-11-13 v1 人工智能
摘要
支气管镜针尖相对于患者解剖学的内操作定位仍具有挑战性,由于呼吸运动、解剖变异性和CT至身体差异导致变形和错位,这些因素在内操作视图和术前CT之间造成不匹配.现有的视觉方法往往无法在不同域和患者之间获得良好泛化,导致残余对齐误差.本工作通过稳健的视觉框架和新的合成基准数据集建立了支气管镜导航的通用基础,以实现标准化和可重复的评估.我们提出了一种视觉姿态优化框架,用于内操作内窥镜视图与术前CT解剖学之间的帧级2D-3D配准.通过微调的模态和领域不变编码器,实现了实内窥镜RGB帧与CT渲染深度图之间的直接相似性计算,而可微渲染模块通过深度一致性迭代细化相机姿态.为提高可重复性,我们引入了支气管镜导航的第一个公共合成基准数据集,弥补了缺乏配对CT-内窥镜数据的不足.在仅使用与基准数据集不同的合成数据训练的情况下,我们的模型实现了平均为2.65 mm的平移误差和0.19 rad的旋转误差,证明了精确且稳定的定位.定性结果进一步在真实患者数据上确认了强大的跨域泛化,在无需特定领域适应的情况下实现了一致的帧级2D-3D对齐.总体而言,提出的框架通过迭代视觉优化实现了稳健且领域不变的定位,而新的基准为视觉支气管镜导航的标准化进展提供了基础.
引用
@article{arxiv.2511.09443,
title = {BronchOpt : Vision-Based Pose Optimization with Fine-Tuned Foundation Models for Accurate Bronchoscopy Navigation},
author = {Hongchao Shu and Roger D. Soberanis-Mukul and Jiru Xu and Hao Ding and Morgan Ringel and Mali Shen and Saif Iftekar Sayed and Hedyeh Rafii-Tari and Mathias Unberath},
journal= {arXiv preprint arXiv:2511.09443},
year = {2025}
}