中文

面向稳健情境感知外科点追踪的视觉-语言桥接:VL-SurgPT 数据集与基准

计算机视觉与模式识别 2025-11-18 v1

摘要

在外科环境中进行点追踪仍具有挑战性,由于存在烟雾遮挡、光斑反射和组织变形等复杂视觉条件。虽然现有外科跟踪数据集提供了坐标信息,但缺乏理解跟踪故障机制所必需的语义上下文。我们引入 VL-SurgPT,这是第一个大规模多模态数据集,将视觉跟踪与外科场景中点状态的文本描述相连接。该数据集包含 908 条体内视频片段,其中 754 条用于组织跟踪(跨越五个具有挑战性情境的 17,171 个标注点)和 154 条用于器械跟踪(覆盖七种器械类型并提供详细的关键点标注)。我们建立了使用八种最先进跟踪方法的综合基准,并提出了 TG-SurgPT,这是一种受文本引导的跟踪方法,利用语义描述以提高在视觉条件严苛情况下的鲁棒性。实验结果表明,纳入点状态信息显著提高了跟踪精度和可靠性,尤其是在常规视觉单模态方法难以应对的恶劣视觉情境下。通过桥接视觉与语言模态,VL-SurgPT 使开发能够在挑战性手术期间条件下仍保持性能的情境感知跟踪系统成为可能,这对于推进计算机辅助外科应用具有重要意义。

关键词

引用

@article{arxiv.2511.12026,
  title  = {Bridging Vision and Language for Robust Context-Aware Surgical Point Tracking: The VL-SurgPT Dataset and Benchmark},
  author = {Rulin Zhou and Wenlong He and An Wang and Jianhang Zhang and Xuanhui Zeng and Xi Zhang and Chaowei Zhu and Haijun Hu and Hongliang Ren},
  journal= {arXiv preprint arXiv:2511.12026},
  year   = {2025}
}

备注

AAAI 2026 oral