医学视觉通用模型:统一医学影像任务的上下文
计算机视觉与模式识别
2024-06-11 v1
摘要
本研究提出了Medical Vision Generalist (MVG),这是首个能够在统一的图像到图像生成框架中处理各种医学影像任务(如跨模态合成、图像分割、去噪和图像填充)的基础模型。具体而言,MVG采用基于提示的生成策略,将输入和输出标准化为图像。通过将这些任务视为以提示图像-标签对和输入图像为条件的图像生成过程,这种方法实现了对不同模态和数据集中任务的灵活统一。为充分利用局部和全局上下文,我们设计了一种结合掩码图像建模与自回归训练的混合方法,用于条件图像生成。这种混合方法在所有涉及的医学影像任务中实现了最鲁棒的性能。为严格评估MVG的能力,我们构建了首个综合性医学视觉基准数据集,包含13个数据集,涵盖四种影像模态(CT、MRI、X光和微超声)。我们的结果一致证明了MVG的优越性能,优于现有的视觉通用模型,如Painter和LVM。此外,MVG表现出强大的可扩展性,其性能在训练更多样化任务时显著提升,并且可以仅通过最小数量的任务特定样本即可有效适应未见数据集。代码可在 \url{https://github.com/OliverRensu/MVG} 提供。
引用
@article{arxiv.2406.05565,
title = {Medical Vision Generalist: Unifying Medical Imaging Tasks in Context},
author = {Sucheng Ren and Xiaoke Huang and Xianhang Li and Junfei Xiao and Jieru Mei and Zeyu Wang and Alan Yuille and Yuyin Zhou},
journal= {arXiv preprint arXiv:2406.05565},
year = {2024}
}