中文

利用场景图知识推进手术视觉问答

计算机视觉与模式识别 2024-06-25 v3 人工智能

摘要

现代手术室正变得日益复杂,需要创新的手术中支持系统。虽然手术数据科学的重点主要集中在视频分析上,但将手术计算机视觉与语言能力相结合正成为一种必要。我们的工作旨在利用场景图知识推进手术背景下的视觉问答 (VQA),解决当前手术 VQA 系统中的两个主要挑战:消除手术 VQA 数据集中的问题条件偏差,以及在手术 VQA 模型设计中融入场景感知推理。首先,我们提出了基于手术场景图的数据集 SSG-QA,该数据集通过对公开可用数据集应用分割和检测模型生成。我们利用器械和解剖结构的空间及动作信息构建手术场景图。这些图被输入到问题引擎中,生成多样化的问答对。与现有的手术 VQA 数据集相比,我们的 SSG-QA 数据集提供了更复杂、更多样、基于几何基础、无偏差且面向手术动作的数据集。随后,我们提出了 SSG-QA-Net,这是一种新颖的手术 VQA 模型, Incorporating 一个轻量级的场景嵌入交互模块 (SIM),该模块通过在文本特征和场景特征之间采用交叉注意力机制,将几何场景知识整合到 VQA 模型设计中。我们对 SSG-QA 数据集的综合分析表明,SSG-QA-Net 在不同问题类型和复杂度上均优于现有方法。我们强调,当前手术 VQA 系统的主要局限性在于缺乏回答复杂查询所需的场景知识。我们提出了一种新颖的手术 VQA 数据集和模型,并表明通过在 VQA 模型设计中整合几何场景特征可以显著改善结果。源代码和数据集将公开于:https://github.com/CAMMA-public/SSG-QA

关键词

引用

@article{arxiv.2312.10251,
  title  = {Advancing Surgical VQA with Scene Graph Knowledge},
  author = {Kun Yuan and Manasi Kattel and Joel L. Lavanchy and Nassir Navab and Vinkle Srivastav and Nicolas Padoy},
  journal= {arXiv preprint arXiv:2312.10251},
  year   = {2024}
}

备注

IPCAI 2024, Int J CARS (2024)