SAP-Bench:面向手术行动规划的多模态大语言模型基准
计算机视觉与模式识别
2025-06-16 v2 计算与语言
摘要
有效的评估是推动 MLLM 研究进步的关键。手术行动规划 (SAP) 任务旨在从视觉输入生成未来动作序列,要求具备精确且复杂的分析能力。不同于数学推理,手术决策 operates in life-critical 环境,需采用严谨、可验证的流程以确保可靠性和患者安全。该任务要求区分原子视觉动作并协调复杂、长期限的程序,这些能力当前基准测试不足之处。为填补这一差距,我们引入 SAP-Bench,一个大规模高质量数据集,旨在使多模态大语言模型 (MLLM) 能够进行可解释的手术行动规划。我们的 SAP-Bench 数据集基于腹腔镜胆囊切除手术场景(平均时长 1137.5 秒),引入时间锚定的手术动作标注,包含 1,226 个临床验证的动作剪辑(平均时长 68.7 秒),覆盖五种基本手术动作,涵盖 74 例手术。数据集提供 1,152 个战略抽样的当前帧,每帧配有对应的下一动作作为多模态分析锚点。我们提出的 MLLM-SAP 框架利用 MLLM 从当前手术场景和自然语言指令中生成下一步行动建议,并注入手术领域知识。为评估数据集的有效性及当前模型的更广泛能力,我们测试了七个最先进的 MLLM(如 OpenAI-o1、GPT-4o、QwenVL2.5-72B、Claude-3.5-Sonnet、GeminiPro2.5、Step-1o 和 GLM-4v),揭示了下一步行动预测性能的关键缺口。
引用
@article{arxiv.2506.07196,
title = {SAP-Bench: Benchmarking Multimodal Large Language Models in Surgical Action Planning},
author = {Mengya Xu and Zhongzhen Huang and Dillan Imans and Yiru Ye and Xiaofan Zhang and Qi Dou},
journal= {arXiv preprint arXiv:2506.07196},
year = {2025}
}
备注
The authors could not reach a consensus on the final version of this paper, necessitating its withdrawal