PitVQA:面向垂体手术的图像 grounding 文本嵌入 LLM 用于视觉问答
计算机视觉与模式识别
2024-05-24 v1
摘要
在外科手术领域中利用大语言模型(LLM)进行视觉问答(VQA),为提高术中决策并促进直观的外科医生与 AI 交互提供了独特机遇。然而,由于缺乏具有复杂推理任务的多样且广泛的数据集,以及图像和文本两种信息类型固有的差异性以及对齐复杂性,导致针对外科手术 VQA 的 LLM 开发受到阻碍。本文引入 PitVQA,一个专为鼻腔垂体手术设计的新型数据集,以及 PitVQA-Net,一种针对外科手术 VQA 的 GPT2 变体,其采用 novel image-grounded text embedding。PitVQA 包含 25 期程序视频,以及涵盖关键外科方面如阶段和步骤识别、情境理解、工具检测与定位以及工具组织相互作用的丰富问答对集合。PitVQA-Net 由 novel image-grounded text embedding 构成,其将图像和文本特征投影到共享的嵌入空间,并搭载 GPT2 主干网络附带激发块分类头,以在复杂的鼻腔垂体手术领域中生成情境相关的答案。我们的 image-grounded text embedding 利用联合嵌入、交叉注意和情境表示来理解问题与手术图像之间的情境关系。我们在 PitVQA 和公开可用的 EndoVis18-VQA 数据集上 demonstrate PitVQA-Net 的有效性,分别相对于最新的基线实现了 8% 和 9% 的平衡准确率提升。我们的代码和数据集可在 https://github.com/mobarakol/PitVQA 上获取。
引用
@article{arxiv.2405.13949,
title = {PitVQA: Image-grounded Text Embedding LLM for Visual Question Answering in Pituitary Surgery},
author = {Runlong He and Mengya Xu and Adrito Das and Danyal Z. Khan and Sophia Bano and Hani J. Marcus and Danail Stoyanov and Matthew J. Clarkson and Mobarakol Islam},
journal= {arXiv preprint arXiv:2405.13949},
year = {2024}
}
备注
10 pages, 3 figures