中文

Surgical-LLaVA:基于大语言和视觉模型的手术场景理解

计算机视觉与模式识别 2024-10-15 v1 人工智能

摘要

由大语言模型驱动的对话代理正在革新我们与视觉数据交互的方式。最近,大规模视觉语言模型(LVLMs)在图像和视频方面得到了广泛研究。然而,这些研究通常只关注常见场景。本文提出一种专为手术场景设计的LVLMs。我们将手术图像和视频的视觉表征整合到语言特征空间中,从而构建一个在手术场景指令数据上进行微调的LVLMs模型,称为Surgical-LLaVA。我们的实验表明,Surgical-LLaVA在手术语境下展现出惊人的多模态聊天能力,在未见过的指令上偶尔显示出多模态行为。我们对手术场景的视觉问答数据集进行量化评估。结果表明,Surgical-LLaVA的性能优于先前工作,表明该模型有望处理更复杂的手术场景。

关键词

引用

@article{arxiv.2410.09750,
  title  = {Surgical-LLaVA: Toward Surgical Scenario Understanding via Large Language and Vision Models},
  author = {Juseong Jin and Chang Wook Jeong},
  journal= {arXiv preprint arXiv:2410.09750},
  year   = {2024}
}

备注

NeurIPS 2024 AIM-FM Workshop