CAT-ViL:用于机器人手术中视觉问答定位回答的协同注意力门控视觉-语言嵌入
计算机视觉与模式识别
2023-08-22 v3 人工智能
机器人学
摘要
医学生和初级外科医生在学习手术时常常依赖资深外科医生和专家来解答问题。然而,专家往往忙于临床和学术工作,很少有时间给予指导。同时,现有的基于深度学习(DL)的手术视觉问答(VQA)系统只能提供简单答案,而不包含答案的位置。此外,视觉-语言(ViL)嵌入在这类任务中仍是一个较少被探索的研究方向。因此,一个手术视觉问答定位回答(VQLA)系统将有助于医学生和初级外科医生从已记录的手术视频中学习并理解。我们提出了一种端到端 Transformer,带有协同注意力门控视觉-语言(CAT-ViL)嵌入,用于手术场景下的 VQLA,其无需通过检测模型进行特征提取。CAT-ViL 嵌入模块旨在融合来自视觉和文本来源的多模态特征。融合后的嵌入将输入一个标准的 Data-Efficient Image Transformer(DeiT)模块,之后再接入并行分类器和检测器进行联合预测。我们在 MICCAI EndoVis Challenge 2017 和 2018 的公开手术视频上进行了实验验证。实验结果表明,与最先进的方法相比,我们提出的模型具有更优的性能和鲁棒性。消融实验进一步证明了所有提出组件的出色性能。所提方法为手术场景理解提供了一种有前景的解决方案,并为基于人工智能(AI)的手术训练 VQLA 系统迈出了第一步。我们的代码已公开可用。
引用
@article{arxiv.2307.05182,
title = {CAT-ViL: Co-Attention Gated Vision-Language Embedding for Visual Question Localized-Answering in Robotic Surgery},
author = {Long Bai and Mobarakol Islam and Hongliang Ren},
journal= {arXiv preprint arXiv:2307.05182},
year = {2023}
}
备注
To appear in MICCAI 2023. Code availability: https://github.com/longbai1006/CAT-ViL