中文

BREATH-VL:基于语义-几何融合的 6 自由度 bronchoscopy 定位

计算机视觉与模式识别 2026-01-08 v1

摘要

视觉语言模型(VLM)最近在利用大规模预训练实现语义理解方面表现突出,然而将其应用于 6 自由度内镜摄像机定位,面临诸多挑战:1)现实医疗环境中缺乏大规模、高质量、密集标注且以定位为导向的视觉语言数据集;2)细粒度姿态回归能力有限;3)提取历史帧特征时计算延迟高。为此,我们首先构建BREATH数据集,目前最大规模的体内内镜定位数据集,收集于复杂人类气道中。基于该数据集,我们提出BREATH-VL,一种融合VLM语义线索与基于视觉的注册方法几何信息的混合框架,以实现精准的 6 自由度姿态估计。我们的动机源于两种方法的互补优势:VLM提供通用语义理解,注册方法提供精确几何对齐。为进一步提升VLM捕获时序上下文的能力,我们引入轻量级上下文学习机制,将运动历史编码为语言提示,实现高效时序推理,无需昂贵的视频级计算。大量实验表明,视觉语言模块在挑战性手术场景中提供稳健的语义定位。基于此,我们的BREATH-VL在准确性和泛化性上均优于最先进的仅视觉定位方法,译向误差较最佳基线降低25.5%,同时保持竞争的计算延迟。

关键词

引用

@article{arxiv.2601.03713,
  title  = {BREATH-VL: Vision-Language-Guided 6-DoF Bronchoscopy Localization via Semantic-Geometric Fusion},
  author = {Qingyao Tian and Bingyu Yang and Huai Liao and Xinyan Huang and Junyong Li and Dong Yi and Hongbin Liu},
  journal= {arXiv preprint arXiv:2601.03713},
  year   = {2026}
}