SUREON:手术推理基准与视觉语言模型
计算机视觉与模式识别
2026-03-09 v1 人工智能
摘要
外科医生不仅仅是观察——他们要进行解释。当专家观察手术场景时,他们不仅理解正在使用的器械,还理解选择它的原因、它所潜在的风险以及下一步会是什么。当前手术AI无法回答此类问题,主要因为编码手术推理的训练数据在规模上极难标注。然而,手术视频讲座已经包含了正是这种——专家为教学目的讲解意图、原因和 anticipation 的解释。尽管这些讲解本身嘈杂且不结构化,但它们编码了当前手术AI所缺乏的推理。我们介绍SUREON,这是一个大规模视频问答数据集,通过系统性地从手术学术视频中收获这种训练信号。SUREON定义了12个问题类别,涵盖安全评估、决策原因和预测,并使用多智能体管道在规模化地提取和结构化监督信号。在134.7K个片段和170种手术程序类型中,SUREON产生了206.8k个问答对,并构建了一个经专家验证的基准测试,包含354个示例。为评估这种监督信号如何转化为手术推理能力,我们引入了两个模型:SureonVLM,这是一个通过监督微调适应的视觉语言模型,以及SureonVLM-R1,这是一个使用群体相对策略优化训练的推理模型。两个模型都能回答关于手术的复杂问题,在SUREON基准测试中准确率超过84%,并在标准手术感知任务中超越通用领域模型。对SureonVLM-R1的定性分析揭示了明确的推理行为,例如从视觉上下文推断手术意图。
引用
@article{arxiv.2603.06570,
title = {SUREON: A Benchmark and Vision-Language-Model for Surgical Reasoning},
author = {Alejandra Perez and Anita Rau and Lee White and Busisiwe Mlambo and Chinedu Nwoye and Muhammad Abdullah Jamal and Omid Mohareri},
journal= {arXiv preprint arXiv:2603.06570},
year = {2026}
}