中文

面向统一外科场景理解:通过 MLLMs 桥接推理与 grounding

计算机视觉与模式识别 2026-05-14 v1 人工智能

摘要

外科场景理解是计算机辅助介入的基石。虽然近期进展,特别是在外科图像分割方面,推动了进展,但实际临床应用需要一种更全面的理解,能够同时捕获程序化上下文、语义推理和精确的视觉 grounding。然而,现有方法通常以孤立的方式处理这些组件,导致片段化的表征和有限的语义一致性。为此,本文提出 SurgMLLM,一个统一的外科场景理解框架,旨在单个模型中桥接高层推理与低层视觉 grounding。给定外科视频,SurgMLLM 对多模态大语言模型(MLLM)进行微调,以支持结构化可解释推理,用于联合建模阶段、器械-动作-目标(IVT)三元组以及三元组-实体分割标记。这些标记随后被时间聚合,作为分割网络的提示,以实现对三元组器械和目标的像素级 grounding。整个框架通过统一目标函数进行端到端训练,该目标函数将语言推理监督与视觉 grounding 损失耦合,促进跨任务学习和临床一致的场景表征。为便于统一评估,我们引入 CholecT45-Scene,将 CholecT45 数据集扩展为 64,299 帧的器械和目标的像素级掩码标注,与现有三元组标签对齐。广泛的实验表明,SurgMLLM 在外科场景理解方面显著推进,提高了主要的三元组识别指标 AP_IVT 从 40.7% 提升至 46.0%,并在阶段识别和分割方面 consistently 优于先前方法。这些结果凸显了统一推理与 grounding 对可靠、情境感知的外科辅助的有效性。

关键词

引用

@article{arxiv.2605.13530,
  title  = {Towards Unified Surgical Scene Understanding:Bridging Reasoning and Grounding via MLLMs},
  author = {Jincai Huang and Shihao Zou and Yuchen Guo and Jingjing Li and Wei Ji and Kai Wang and Shanshan Wang and Weixin Si},
  journal= {arXiv preprint arXiv:2605.13530},
  year   = {2026}
}