中文

EyePCR:面向眼科手术中精细感知、知识理解与临床推理的全面基准

计算机视觉与模式识别 2025-10-03 v2

摘要

多模态大语言模型(MLLMs)在高风险、领域特定场景(如手术环境)中的表现尚未得到广泛探索。为填补这一空白,我们开发了—EyePCR—一个规模庞大的眼科手术分析基准,依托结构化临床知识,对模型在“感知”、“理解”和“推理”三方面的认知能力进行评估。EyePCR 提供了超过 21 万个标注后的问答数据,覆盖 1048 个细粒度属性用于多视角感知、超过 25 千个三元组的医学知识图用于理解,以及四项临床验证的推理任务。丰富的标注有助于深入的认知分析,模拟手术医生如何感知视觉线索并将其与领域知识结合作出决策,从而显著提升模型的认知能力。在具体表现上,EyePCR-MLLM(一个针对眼科领域进行适配的 Qwen2.5-VL-7B 变体)在感知类题目中准确率居于所比较模型之首,并在理解与推理方面超越开源模型,与商业模型如 GPT-4.1 相抗衡。EyePCR 揭示了现有 MLLMs 在手术认知方面的局限性,为建立和提升手术视频理解模型的临床可靠性奠定了基础。

关键词

引用

@article{arxiv.2509.15596,
  title  = {EyePCR: A Comprehensive Benchmark for Fine-Grained Perception, Knowledge Comprehension and Clinical Reasoning in Ophthalmic Surgery},
  author = {Gui Wang and Yang Wennuo and Xusen Ma and Zehao Zhong and Zhuoru Wu and Ende Wu and Rong Qu and Wooi Ping Cheah and Jianfeng Ren and Linlin Shen},
  journal= {arXiv preprint arXiv:2509.15596},
  year   = {2025}
}

备注

Strong accept by NeurIPS2025 Reviewers and AC