中文

Bi-VLGM:用于文本引导医学图像分割的双层类别-严重程度感知视觉-语言图匹配

图像与视频处理 2023-05-23 v1 计算机视觉与模式识别 机器学习

摘要

含有大量信息的医学报告可自然补充医学图像以用于计算机视觉任务,而视觉与语言之间的模态鸿沟可通过视觉-语言匹配(VLM)来解决。然而,当前的视觉-语言模型扭曲了模态内关系,且主要在提示学习中包含类别信息,这对于分割任务而言是不够的。本文提出一种用于文本引导医学图像分割的双层类别-严重程度感知视觉-语言图匹配(Bi-VLGM),由词级 VLGM 模块和句级 VLGM 模块组成,以利用视觉-文本特征间的类别-严重程度感知关系。在词级 VLGM 中,为缓解 VLM 过程中扭曲的模态内关系,我们将 VLM 重新表述为图匹配问题,并引入视觉-语言图匹配(VLGM)以挖掘视觉-文本特征间的高阶关系。随后,我们在每个类别区域的局部特征与类别感知提示之间执行 VLGM,以弥合其鸿沟。在句级 VLGM 中,为给分割任务提供疾病严重程度信息,我们引入严重程度感知提示来量化视网膜病变的严重程度级别,并在全局特征与严重程度感知提示之间执行 VLGM。通过利用局部(全局)与类别(严重程度)特征之间的关系,分割模型可有选择地学习类别感知与严重程度感知信息以提升性能。大量实验证明了我们方法的有效性及其相对于现有方法的优越性。源代码将予以发布。

关键词

引用

@article{arxiv.2305.12231,
  title  = {Bi-VLGM : Bi-Level Class-Severity-Aware Vision-Language Graph Matching for Text Guided Medical Image Segmentation},
  author = {Chen Wenting and Liu Jie and Yuan Yixuan},
  journal= {arXiv preprint arXiv:2305.12231},
  year   = {2023}
}