SurgMLLMBench:面向手术场景理解的多模态大语言模型基准数据集
计算机视觉与模式识别
2025-11-27 v1 人工智能
摘要
近期 multimodal large language models (LLMs) 的快速发展凸显了其在医学和手术领域的潜在应用价值。然而,现有手术数据集主要采用视觉问答 (VQA) 格式,存在分类体系不统一且不支持像素级分割的问题,限制了一致的评估和实际应用。我们提出 SurgMLLMBench,一个为开发和评估面向手术场景理解的交互式多模态 LLM 而设计的统一基准测试,包括新收集的 Micro-surgical Artificial Vascular anastomosIS (MAVIS) 数据集。它整合了腹腔手术、机器人辅助手术和微创手术领域的像素级器械分割掩码和结构化 VQA 标注,在统一的分类体系下实现了全面评估,超越传统 VQA 任务,支持更丰富的视觉-对话交互。大量基线实验表明,在 SurgMLLMBench 上训练的单一模型可在各领域实现一致性能,并能有效泛化到未见数据集。SurgMLLMBench 将作为公开资源发布,旨加速多模态手术 AI 研究,支持可复现的评估和交互式手术推理模型的开发。
引用
@article{arxiv.2511.21339,
title = {SurgMLLMBench: A Multimodal Large Language Model Benchmark Dataset for Surgical Scene Understanding},
author = {Tae-Min Choi and Tae Kyeong Jeong and Garam Kim and Jaemin Lee and Yeongyoon Koh and In Cheul Choi and Jae-Ho Chung and Jong Woong Park and Juyoun Park},
journal= {arXiv preprint arXiv:2511.21339},
year = {2025}
}
备注
10 pages, 5 figures