中文

基于基础模型的数据自适应少样本多标签分割

计算机视觉与模式识别 2024-10-15 v1

摘要

获取图像分割和定位的准确标注成本很高,因此使用单样本或少样本算法显得尤为吸引人。虽然已涌现出多种先进的少样本分割方法,包括基于文本的提示方法,但对医学图像的性能仍不理想。利用现有基于Vision Transformer(ViT)的基础模型在亚像素级特征上识别基于单个模板图像的相似感兴趣区域(RoI),已被证明对医学图像中的单样本分割和定位非常有效,可跨模态应用。然而,这些方法依赖于模板图像和测试图像之间的良好匹配,以及简单相关性足以获取对应关系。在实际情况下,这种方法可能无法在临床数据中泛化,由于患者姿势变化、同一模态内的协议间变异,甚至扩展到3D数据时仅使用单个模板图像。此外,对于多标签任务,必须顺序执行RoI识别。为此,本文提出一种基于基础模型(FM)的适配器,用于单标签、多标签局部化和分割,以解决上述问题。我们演示了该方法在多个分割和定位任务上的有效性,涵盖2D和3D数据以及不同姿势的临床数据,并对比了当前最先进的少样本分割方法。

关键词

引用

@article{arxiv.2410.09759,
  title  = {Data Adaptive Few-shot Multi Label Segmentation with Foundation Model},
  author = {Gurunath Reddy and Dattesh Shanbhag and Deepa Anand},
  journal= {arXiv preprint arXiv:2410.09759},
  year   = {2024}
}