中文

基于基础模型的医学图像一次性定位与分割

计算机视觉与模式识别 2023-10-31 v1 人工智能

摘要

视觉Transformer(ViT)与稳定扩散(SD)模型近期在捕捉图像丰富语义特征方面的进展,已被用于自然图像上的图像对应任务。本文考察了多种仅在自然图像上预训练的ViT(DINO、DINOv2、SAM、CLIP)与SD模型,在解决医学图像对应问题上的能力。尽管许多工作主张领域内训练,我们表明,在自然图像上训练的模型能够在来自不同厂商的多种模态(CT、MR、超声)、多个解剖区域(脑、胸、腹、四肢)以及广泛任务上,为医学图像提供良好性能。进一步,我们利用相对于模板图像的对应关系来提示Segment Anything(SAM)模型,从而实现单次分割,仅使用一张图像作为参考,在各任务上达到62%–90%的Dice系数范围。我们还表明,在多数医学成像模态的语义分割任务(七项中的六项)上,我们的一次性方法优于近期提出的少样本分割方法UniverSeg(Dice系数范围47%–80%)。

关键词

引用

@article{arxiv.2310.18642,
  title  = {One-shot Localization and Segmentation of Medical Images with Foundation Models},
  author = {Deepa Anand and Gurunath Reddy M and Vanika Singhal and Dattesh D. Shanbhag and Shriram KS and Uday Patil and Chitresh Bhushan and Kavitha Manickam and Dawei Gui and Rakesh Mullick and Avinash Gopal and Parminder Bhatia and Taha Kass-Hout},
  journal= {arXiv preprint arXiv:2310.18642},
  year   = {2023}
}

备注

Accepted at NeurIPS 2023 R0-FoMo Workshop