PRISM:一种面向可视提示并具鲁棒性的交互式分割模型
计算机视觉与模式识别
2024-04-24 v1
摘要
本文提出了 PRISM(Promptable and Robust Interactive Segmentation Model),旨在对 3D 医学图像进行精确分割。PRISM 接受各种视觉输入,包括点、框和草图等稀疏提示,以及掩码等稠密提示。具体而言,PRISM 依据四项原则设计以实现鲁棒性:(1)迭代学习。该模型通过利用前一次迭代中的视觉提示来实现分段的渐进式改进。(2)置信度学习。PRISM 为每个输入图像采用多个分割头,每组分别生成连续图和置信度得分,以优化预测。(3)纠错学习。在每一次分割迭代之后,PRISM 采用浅层纠错细化网络来重新分配被错误标记的体素。(4)混合设计。PRISM 集成混合编码器,以更好地捕获局部和全局信息。对 PRISM 进行了全面验证,采用四个公开数据集进行肿瘤分割,分别涉及结肠、胰腺、肝脏和肾脏,突出了由于解剖变异和边界模糊导致的准确肿瘤识别挑战。与当前最先进的方法相比,无论是否进行提示工程,PRISM 均显著提高了性能,取得接近人类水平的结果。代码已公开 available at https://github.com/MedICL-VU/PRISM。
引用
@article{arxiv.2404.15028,
title = {PRISM: A Promptable and Robust Interactive Segmentation Model with Visual Prompts},
author = {Hao Li and Han Liu and Dewei Hu and Jiacheng Wang and Ipek Oguz},
journal= {arXiv preprint arXiv:2404.15028},
year = {2024}
}