中文

Surgical-LVLM:针对外科手术中 grounded 视觉问答的大型视觉语言模型自适应学习

计算机视觉与模式识别 2025-03-18 v3 人工智能 机器人学 图像与视频处理

摘要

近期在外科视觉问答(Surgical-VQA)及相关区域定位方面的突破显示出巨大的潜力,为机器人和医疗应用提供了解决方案,应对个人化外科指导中自动化方法的迫切需求。然而,现有模型主要提供简单的结构化答案,由于在识别长程依赖和对齐多模态信息方面的能力有限,难以应对复杂场景。本文引入 Surgical-LVLM,一种为复杂外科场景量身定制的新型个人化大型视觉语言模型。我们利用预训练的大型视觉语言模型和专用的视觉感知 LoRA(VP-LoRA)模块,使模型在外科语境下擅长理解复杂的视觉语言任务。在解决视觉定位任务时,我们提出了 Token-Interaction(TIT)模块,通过将其投影到潜在空间后,强化了定位模块与大型视觉语言模型(LVLM)语言响应之间的交互。我们在多个基准测试中展示了 Surgical-LVLM 的有效性,包括 EndoVis-17-VQLA、EndoVis-18-VQLA 以及一个新引入的 EndoVis 对话数据集,后者为该领域设定了新的性能标准。我们的工作通过提供一种情境感知解决方案,推动了自动化外科指导领域的发展。

关键词

引用

@article{arxiv.2405.10948,
  title  = {Surgical-LVLM: Learning to Adapt Large Vision-Language Model for Grounded Visual Question Answering in Robotic Surgery},
  author = {Guankun Wang and Long Bai and Wan Jun Nah and Jie Wang and Zhaoxi Zhang and Zhen Chen and Jinlin Wu and Mobarakol Islam and Hongbin Liu and Hongliang Ren},
  journal= {arXiv preprint arXiv:2405.10948},
  year   = {2025}
}

备注

The manuscript is accepted by ICLR 2025 FM-Wild Workshop