中文

TP-DRSeg:利用显式文本提示辅助 SAM 提升糖尿病视网膜病变病灶分割

计算机视觉与模式识别 2024-06-25 v1

摘要

近期大型基础模型,如 Segment Anything Model(SAM),在各类任务中展现出巨大的潜力。尽管取得了进展,这些模型仍在专门医学图像分析中遇到挑战,尤其是难以识别糖尿病视网膜病变(DR)病灶分割中细微的类别差异。本文提出一种新框架,将 SAM 定制化用于文本提示下的 DR 病灶分割,称为 TP-DRSeg。我们的核心思想是利用语言线索将医学先验知识注入视觉模型,从而结合不同基础模型的优势,增强分割的可信度。具体而言,为充分发挥视觉语言模型在医学概念识别方面的潜力,我们提出了显式先验编码器,将隐式医学概念转化为显式先验知识,为挖掘与病灶相关的低层特征提供可解释线索。此外,我们设计了先验对齐注入器,将显式先验注入分割过程,可实现跨多模态特征的知识共享,同时允许该框架以参数高效的方式进行训练。实验结果表明,我们的框架优于传统模型和其他基础模型变体。

关键词

引用

@article{arxiv.2406.15764,
  title  = {TP-DRSeg: Improving Diabetic Retinopathy Lesion Segmentation with Explicit Text-Prompts Assisted SAM},
  author = {Wenxue Li and Xinyu Xiong and Peng Xia and Lie Ju and Zongyuan Ge},
  journal= {arXiv preprint arXiv:2406.15764},
  year   = {2024}
}