中文

面向手术场景的对抗性对比学习:针对外科手术的校准鲁棒视觉-语言定位式问题解答

计算机视觉与模式识别 2024-09-04 v2 机器人学

摘要

医学视觉问题解答 (VQA) 承接了视觉信息与临床决策之间的鸿沟,使医生能够从临床图像和视频中提取理解。尤其,手术 VQA 可增强手术数据的解释,助力准确诊断、有效教育及临床干预。然而,现有 VQA 模型无法视觉地指示与给定问题对应的感兴趣区域,导致对手术场景的理解不完整。为此,我们提出手术视觉问题定位式解答 (VQLA),以针对手术图像的特定查询提供精确且情境感知的响应。此外,为解决手术场景对安全性的高需求以及图像获取与传输中潜在的噪声干扰问题,我们提出一种名为校准式共注意力门控视觉-语言 (C2^2G-ViL) 的新方法,以有效集成并对齐多模态信息。我们还利用基于对抗样本的对比学习策略以提升性能与鲁棒性。我们还扩展了 EndoVis-18-VQLA 和 EndoVis-17-VQLA 数据集以拓宽数据范围和应用。在上述数据集上进行大量实验表明,我们的解决方案在性能和鲁棒性方面表现卓越。我们的解决方案能够有效抵御真实世界的图像噪声。因此,我们提出的方法可作为辅助手术教育、患者护理及提升手术结果的有效工具。

关键词

引用

@article{arxiv.2408.04958,
  title  = {Surgical-VQLA++: Adversarial Contrastive Learning for Calibrated Robust Visual Question-Localized Answering in Robotic Surgery},
  author = {Long Bai and Guankun Wang and Mobarakol Islam and Lalithkumar Seenivasan and An Wang and Hongliang Ren},
  journal= {arXiv preprint arXiv:2408.04958},
  year   = {2024}
}

备注

Accepted by Information Fusion. Code and data availability: https://github.com/longbai1006/Surgical-VQLAPlus