中文

Surgical-VQLA:具有门控视觉-语言嵌入的 Transformer 用于机器人手术中的视觉问题定位回答

计算机视觉与模式识别 2023-05-22 v1 人工智能 计算与语言 机器学习 机器人学

摘要

尽管有计算机辅助模拟器和手术过程录像可用,初级住院医师仍严重依赖专家来解答疑问。然而,外科专家常因临床与学术工作负荷过重而限制答疑时间。为此,我们开发了一套手术问答系统,以从录像中促进机器人辅助手术场景与活动理解。现有大多数 VQA 方法需要目标检测器和基于区域的特征提取器来提取视觉特征,并将其与问题的嵌入文本融合以生成答案。然而,(1) 由于数据集较小且缺乏边界框标注,手术目标检测模型稀缺;(2) 当前文本与图像等异质模态的融合策略较为朴素;(3) 缺失定位回答,而这在复杂手术场景中至关重要。本文中,我们提出机器人手术中的视觉问题定位回答 (Surgical-VQLA),在答案预测过程中定位特定手术区域。为处理异质模态的融合,我们设计了门控视觉-语言嵌入 (GVLE) 来为语言视觉 Transformer (LViT) 构建输入块以预测答案。为获得定位,我们在 LViT 的预测头并行添加了检测头。我们还集成 GIoU 损失,以在保持问答模型准确性的同时提升定位性能。我们利用来自 MICCAI 挑战赛 EndoVis-17 和 18 的公开手术视频标注了两个 VQLA 数据集。我们的验证结果表明,Surgical-VQLA 能更好地理解手术场景并定位与问答相关的特定区域。GVLE 通过展现优于现有基准的性能,提出了一种高效的视觉-语言嵌入技术。

关键词

引用

@article{arxiv.2305.11692,
  title  = {Surgical-VQLA: Transformer with Gated Vision-Language Embedding for Visual Question Localized-Answering in Robotic Surgery},
  author = {Long Bai and Mobarakol Islam and Lalithkumar Seenivasan and Hongliang Ren},
  journal= {arXiv preprint arXiv:2305.11692},
  year   = {2023}
}

备注

To appear in IEEE ICRA 2023. Code and data availability: https://github.com/longbai1006/Surgical-VQLA