一个融合视觉上下文学习与掩码图像建模的简单框架以改进超声分割
计算机视觉与模式识别
2024-03-11 v3
摘要
传统的深度学习模型逐张处理图像,在医学成像领域需要昂贵且耗时的专家标注,并且领域特定限制限制了模型的泛化能力。视觉上下文学习(ICL)是计算机视觉中一个令人兴奋的新研究领域。与传统深度学习不同,ICL强调模型基于给定示例快速适应新任务的能力。受MAE-VQGAN启发,我们提出了一种新的简单视觉ICL方法SimICL,它将视觉ICL配对图像与为自监督学习设计的掩码图像建模(MIM)相结合。我们在一个标注有限的腕部超声(US)数据集上验证了我们的方法,用于骨骼结构分割,临床目标是分割骨骼结构以帮助进一步检测骨折。我们使用了一个包含来自18名患者的3822张图像的测试集进行骨骼区域分割。SimICL取得了惊人的高Dice系数(DC)0.96和Jaccard指数(IoU)0.92,超过了最先进的分割和视觉ICL模型(最大DC 0.86和IoU 0.76),SimICL的DC和IoU分别提高了0.10和0.16。这种与有限手动标注的惊人高一致性表明,SimICL可以用于在小型超声数据集上训练AI模型。与传统方法相比,这可以大大减少图像标注所需的人类专家时间,并增强AI辅助在超声图像分析中的实际应用。
引用
@article{arxiv.2402.14300,
title = {A Simple Framework Uniting Visual In-context Learning with Masked Image Modeling to Improve Ultrasound Segmentation},
author = {Yuyue Zhou and Banafshe Felfeliyan and Shrimanti Ghosh and Jessica Knight and Fatima Alves-Pereira and Christopher Keen and Jessica Küpper and Abhilash Rakkunedeth Hareendranathan and Jacob L. Jaremko},
journal= {arXiv preprint arXiv:2402.14300},
year = {2024}
}