中文

Surgical-MambaLLM:面向机器人手术 VQLA 的 Mamba2 增强多模态大语言模型

计算机视觉与模式识别 2025-09-23 v1 人工智能

摘要

近年来,机器人手术中的视觉问答定位回答(Surgical-VQLA)因其在辅助医学生和初级医生理解手术场景方面的潜力而备受关注。最近,大语言模型(LLMs)的快速发展为该任务提供了更有前景的解决方案。然而,现有方法难以建立文本与视觉细节之间的复杂依赖关系,且难以感知手术场景的空间信息。为应对这些挑战,我们提出了一种新颖的方法——Surgical-MambaLLM,这是首次在手术领域将 Mamba2 与 LLM 相结合,利用 Mamba2 有效捕获跨模态依赖关系和感知手术场景空间信息的能力,从而增强 LLM 对手术图像的理解。具体而言,我们提出了跨模态双向 Mamba2 集成(CBMI)模块,利用 Mamba2 及其跨模态集成能力进行有效的多模态融合。此外,针对手术场景的几何特征,我们为 Mamba2 设计了手术器械感知(SIP)扫描模式来扫描手术图像,增强了模型对手术场景的空间理解。大量实验表明,我们的 Surgical-MambaLLM 模型在 EndoVis17-VQLA 和 EndoVis18-VQLA 数据集上优于最先进的方法,显著提升了 Surgical-VQLA 任务的性能。

关键词

引用

@article{arxiv.2509.16618,
  title  = {Surgical-MambaLLM: Mamba2-enhanced Multimodal Large Language Model for VQLA in Robotic Surgery},
  author = {Pengfei Hao and Hongqiu Wang and Shuaibo Li and Zhaohu Xing and Guang Yang and Kaishun Wu and Lei Zhu},
  journal= {arXiv preprint arXiv:2509.16618},
  year   = {2025}
}

备注

Early accepted by MICCAI2025