Surg-R1:面向可解释手术决策支持的分层推理基础模型及多中心临床验证
计算机视觉与模式识别
2026-03-16 v1
摘要
手术场景理解不仅需要准确的预测,还需要 surgeon 可验证的可解释推理。然而,现有的手术视觉语言模型在生成预测时缺乏推理链,通用推理模型在缺乏领域特定知识的情况下也难以处理组合手术任务。我们提出 Surg-R1,一款手术视觉语言模型,通过四阶段管道实现分层推理训练。我们的ethods 引入了三个关键贡献:(1)三层推理层次结构将手术解释分解为感知锚定、关系理解和情境推理;(2)构建了规模最大的手术链式思维数据集,包含 32 万对推理对;(3)四阶段训练管道从监督微调、组相对策略优化到迭代自我提升。评估在 SurgBench 上进行,该基准包含六个公开基准和六个来自五个机构的多中心外部验证数据集。结果显示,Surg-R1 在公开基准上的最高 Arena Score 达到 64.9%,显著优于 Gemini 3.0 Pro(46.1%)和 GPT-5.1(37.9%),在仪器定位、三元组识别、阶段识别、动作识别和安全视图评估等任务上超越了专用的手术 VLM 和强大的手术基线模型,在外部验证中取得 15.2 个百分点的提升。
引用
@article{arxiv.2603.12430,
title = {Surg-R1: A Hierarchical Reasoning Foundation Model for Scalable and Interpretable Surgical Decision Support with Multi-Center Clinical Validation},
author = {Jian Jiang and Chenxi Lin and Yiming Gu and Zengyi Qin and Zhitao Zeng and Kun Yuan and Yonghao Long and Xiang Xia and Cheng Yuan and Yuqi Wang and Zijie Yue and Kunyi Yang and Yuting Zhang and Zhu Zhuo and Dian Qin and Xin Wang and NG Chi Fai and Brian Anthony and Daguang Xu and Guy Rosman and Ozanan Meireles and Zizhen Zhang and Nicolas Padoy and Hesheng Wang and Qi Dou and Yueming Jin and Yutong Ban},
journal= {arXiv preprint arXiv:2603.12430},
year = {2026}
}