中文

SurgVLM:面向外科智能的大型视觉语言模型与系统评估基准

计算机视觉与模式识别 2025-06-04 v1

摘要

基础模型通过对多模态数据进行整体理解,在生物医学领域取得了变革性成功。然而,其在外科领域的应用仍有待深入探索。外科智能带来了独特的挑战,需要外科视觉感知、时间分析和推理。由于缺乏特定领域的监督以及大规模高质量的外科数据库,现有的通用视觉语言模型无法满足这些需求。为了填补这一空白,我们提出了 SurgVLM,这是首批用于外科智能的大型视觉语言基础模型之一,该单一通用模型能够处理多种外科任务。为此,我们构建了一个大规模多模态外科数据库 SurgVLM-DB,包含超过 181 万帧图像和 779 万段对话,涵盖 16 种以上的外科手术类型和 18 种解剖结构。我们统一并重组了 10 项外科任务中的 23 个公开数据集,随后对标签进行标准化,并进行分层视觉语言对齐,以实现对从视觉感知、时间分析到高级推理等逐渐细化的外科任务的全面覆盖。基于这一综合数据集,我们提出了 SurgVLM,它构建于 Qwen2.5-VL 之上,并针对 10 多项外科任务进行了指令微调。我们进一步构建了外科多模态基准 SurgVLM-Bench,用于方法评估。SurgVLM-Bench 由外科领域中 6 个流行且广泛使用的数据集组成,涵盖若干关键的下游任务。基于 SurgVLM-Bench,我们评估了 SurgVLM 的性能(3 种 SurgVLM 变体:SurgVLM-7B、SurgVLM-32B 和 SurgVLM-72B),并与 14 种主流商用 VLM(如 GPT-4o、Gemini 2.0 Flash、Qwen2.5-Max)进行了全面比较。

关键词

引用

@article{arxiv.2506.02555,
  title  = {SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence},
  author = {Zhitao Zeng and Zhu Zhuo and Xiaojun Jia and Erli Zhang and Junde Wu and Jiaan Zhang and Yuxuan Wang and Chang Han Low and Jian Jiang and Zilong Zheng and Xiaochun Cao and Yutong Ban and Qi Dou and Yang Liu and Yueming Jin},
  journal= {arXiv preprint arXiv:2506.02555},
  year   = {2025}
}

备注

29 pages, 5 figures