Surgical-VQA:基于 Transformer 的外科手术场景视觉问答
计算机视觉与模式识别
2022-06-28 v2 人工智能
机器学习
机器人学
图像与视频处理
摘要
手术中的视觉问答(VQA)在很大程度上尚未被探索。专家外科医生稀缺,且常超负荷于临床与学术工作。这种超负荷常限制他们回答患者、医学生或低年资住院医师提出的与手术流程相关问卷的时间。有时,学生和 junior residents 也避免在课堂上问太多问题以减少干扰。尽管计算机辅助模拟器与过往手术记录已可供他们观察并提升技能,他们仍极大依赖医学专家来回答问题。拥有一个可靠“第二意见”的 Surgical-VQA 系统可作为备份,并减轻医学专家回答这些问题的负担。标注医学数据的缺乏与领域特定术语的存在限制了手术流程 VQA 的探索。本工作中,我们设计了一个 Surgical-VQA 任务,基于手术场景回答有关手术流程的问卷。在扩展 MICCAI 内镜视觉挑战赛 2018 数据集与流程识别数据集的基础上,我们引入了两个具有分类与基于句子答案的 Surgical-VQA 数据集。为执行 Surgical-VQA,我们采用视觉-文本 transformer 模型。我们进一步引入了一种基于残差 MLP 的 VisualBert 编码器模型,其强化视觉与文本 token 间的交互,提升了分类式回答的性能。此外,我们研究了输入图像块数量与 temporal visual features 对模型在分类与基于句子回答中性能的影响。
引用
@article{arxiv.2206.11053,
title = {Surgical-VQA: Visual Question Answering in Surgical Scenes using Transformer},
author = {Lalithkumar Seenivasan and Mobarakol Islam and Adithya K Krishna and Hongliang Ren},
journal= {arXiv preprint arXiv:2206.11053},
year = {2022}
}
备注
Code: https://github.com/lalithjets/Surgical_VQA.git