中文

NeuroABench:用于神经外科解剖识别的多模态评估基准

计算机视觉与模式识别 2025-12-09 v1 人工智能 计算与语言

摘要

多模态大语言模型 (Multimodal Large Language Model, MLLM) 在手术视频理解方面显示出巨大的潜力。凭借 improved 的零样本性能和更有效的人机交互,它们为推进手术教育和辅助提供了坚实的基础。然而,现有研究和数据集主要聚焦于理解手术程序和工作流程,较少关注解剖理解这一关键作用。在临床实践中,外科医生高度依赖准确的解剖理解来解释、审查和学习手术视频。为填补这一空白,我们介绍了神经外科解剖基准 (Neurosurgical Anatomy Benchmark, NeuroABench),这是第一个专为评估神经外科领域解剖理解而创建的多模态基准。NeuroABench 包含 9 小时标注的神经外科手术视频,覆盖 89 种不同的操作程序,并采用一种新颖的多模态标注管道开发,该管道经过多轮审核。该基准评估 68 项临床解剖结构的识别,为评估模型性能提供了严格且标准化的框架。在超过 10 个最先进 MLLM 上进行实验,结果显示最佳模型在解剖识别任务中仅达到 40.87% 的准确率。为进一步评估该基准,我们从数据集中提取了一个子集,并对四名神经外科住院医师进行了有意义的测试。结果显示,最佳学生达到了 56% 的准确率,最低分 28%,平均分为 46.5%。虽然最佳 MLLM 的表现相当于最低分的学生,但仍显著落后于该组的平均水平。这一比较既凸显了 MLLM 在解剖理解方面的进展,也强调了在实现人类水平性能方面仍存在的巨大差距。

关键词

引用

@article{arxiv.2512.06921,
  title  = {NeuroABench: A Multimodal Evaluation Benchmark for Neurosurgical Anatomy Identification},
  author = {Ziyang Song and Zelin Zang and Xiaofan Ye and Boqiang Xu and Long Bai and Jinlin Wu and Hongliang Ren and Hongbin Liu and Jiebo Luo and Zhen Lei},
  journal= {arXiv preprint arXiv:2512.06921},
  year   = {2025}
}

备注

Accepted by IEEE ICIA 2025