中文

Med-PerSAM:面向医疗领域的个人化Segment Anything模型的一键视觉提示调优

计算机视觉与模式识别 2024-11-26 v1 人工智能

摘要

利用针对性提示进行的预训练模型进行情境学习在NLP任务中已被证明非常有效。基于这一成功,最近的研究将类似方法应用于Segment Anything Model(SAM),在“单次”框架内,即仅使用单个参考图像及其标签。然而,这些方法在医疗领域面临局限,主要源于SAM对视觉提示的必需性以及对像素相似性用于生成提示的过度依赖。这一依赖可能导致(1)提示生成不准确,以及(2)点提示聚类,从而导致次佳结果。为此,我们引入Med-PerSAM,一个专为医疗领域设计的新颖且简单的单次框架。Med-PerSAM仅使用视觉提示工程,无需对预训练的SAM进行额外训练或人工干预,归功于我们新颖的自动化提示生成过程。通过将我们的轻量级基于变形的提示调优模型与SAM集成,使我们能够提取和迭代细化视觉提示,从而提升预训练SAM的性能。这一进展在医疗领域尤为重要,因为为缺乏医学专业知识者创建视觉提示具有显著挑战性。我们的模型在多样化2D医学影像数据集上超越了各种基础模型和此前的SAM-based方法。

关键词

引用

@article{arxiv.2411.16123,
  title  = {Med-PerSAM: One-Shot Visual Prompt Tuning for Personalized Segment Anything Model in Medical Domain},
  author = {Hangyul Yoon and Doohyuk Jang and Jungeun Kim and Eunho Yang},
  journal= {arXiv preprint arXiv:2411.16123},
  year   = {2024}
}